P-NET 演示数据合成器
DemoData
00 Remarks
真实场景下 P-NET 的输入来自 Armenia 等人队列的 1013 例前列腺癌样本 (体细胞突变经非同义过滤、拷贝数经 GISTIC2.0 调用后取高水平扩增与深缺失的两态编码), 通路层级来自 Reactome 的 3007 条通路。
这里出于演示目的,用代码合成一份结构相同但规模小得多的数据:
- 合成一个由"基因 → 5 层通路"组成的层级,其中第一条最精细通路被强制 填充为论文中所报道的已知驱动基因(AR、TP53、PTEN、RB1、MDM4、FGFR1、NOTCH1、PDGFA 等);
- 以其中若干条精细通路作为"驱动通路",其成员基因作为"驱动基因", 先采样标签,再依据标签决定驱动基因上是否出现对应类型的改变, 其余基因上的改变则作为背景噪声;
- 由于驱动基因聚集在同一条通路之内,标签只能通过"基因 → 通路 → 更粗通路" 这条层级链路被模型学到,因此可以检验生物先验带来的归纳偏置是否真的起作用。
01 Syntax
02 Methods
| Name | Overloads | Summary |
|---|---|---|
| Create | 1 | 一次性生成层级与样本 |
| CreateHierarchy | 1 | 合成一个由基因与 5 层通路组成的类 Reactome 层级 |
| CreateDataset | 1 | 在给定的层级之上合成患者样本 |
03 Properties
| Name | Overloads | Summary |
|---|---|---|
| KnownDriverGenes | 1 | 论文中所报道的若干前列腺癌已知 / 候选驱动基因, 合成数据时会被强制放入第一条最精细通路之中 |
| BackgroundRates | 1 | 基因层面的背景改变率,依次为突变、扩增、缺失 |
| KnownAlterations | 1 | 已知驱动基因在真实样本之中最主要的改变类型 |
| AlterationNames | 1 | 改变类型的显示名称,依次为突变、扩增、缺失 |
04 Members
Int32, Int32, Nullable(Of Int32), Double)一次性生成层级与样本
| Name | Type | Description |
|---|---|---|
geneCount | Int32 | 基因数量,默认 60 |
sampleCount | Int32 | 样本数量,默认 600 |
seed | Nullable(Of Int32) | 随机数种子,给出之后数据可复现 |
positiveRatio | Double | 正样本(转移性 / 耐药)的比例,默认 0.33 |
合成的演示数据集
Int32, Int32(), Nullable(Of Int32))合成一个由基因与 5 层通路组成的类 Reactome 层级
层级按自底向上的方式生成: 先把基因分配到最精细的通路之中(保证每一条通路非空、每一个基因至少属于一条通路), 之后再逐层把下一层的节点随机聚合到上一层的若干父通路之中。
| Name | Type | Description |
|---|---|---|
geneCount | Int32 | 基因数量 |
levelSizes | Int32() | 由精细到粗排列的各层通路数量,默认取 |
seed | Nullable(Of Int32) | 随机数种子 |
合成的层级本体
在给定的层级之上合成患者样本
生成过程为:先按给定比例采样标签,之后
- 对于驱动基因:阳性样本上以较高的概率(默认 0.45)出现其对应的改变类型, 阴性样本上则以较低的概率(默认 0.12)出现;
- 对于其余基因:三种改变类型各自以背景率(约 0.03)随机出现,构成纯噪声。
这样标签只能通过"驱动基因 → 驱动通路 → 更粗通路"这条链路被模型学到, 而背景噪声则用来检验稀疏先验的正则化效果。
| Name | Type | Description |
|---|---|---|
hierarchy | PathwayHierarchy | 层级本体 |
sampleCount | Int32 | 样本数量 |
seed | Nullable(Of Int32) | 随机数种子 |
positiveRatio | Double | 正样本(转移性 / 耐药)比例 |
合成的演示数据集,其中包含用于比对的驱动基因 / 驱动通路真值
论文中所报道的若干前列腺癌已知 / 候选驱动基因, 合成数据时会被强制放入第一条最精细通路之中
基因名数组
基因层面的背景改变率,依次为突变、扩增、缺失
改变率数组
已知驱动基因在真实样本之中最主要的改变类型
论文的 Sankey 图揭示了改变类型与基因之间的对应关系: AR 主要由扩增驱动、TP53 主要由突变驱动、PTEN 主要由缺失驱动。 这里沿用这三类真实对应关系来合成数据, 使得 demo 中"改变类型层面的归因结果"可以直接与真实生物学结论相互印证。
基因名到改变类型下标的映射,0 为突变、1 为扩增、2 为缺失
改变类型的显示名称,依次为突变、扩增、缺失
改变类型名数组