P-NET 的样本数据集
PNETSampleSet
00 Remarks
特征矩阵 PNETSampleSet.Features 的形状为 [样本数, 基因数 × 3], 其中每一个基因按顺序占用 3 列,依次为体细胞突变、拷贝数扩增、拷贝数缺失, 取值均为 0 或者 1 的二值变量(只保留高水平扩增与深缺失的两态编码, 与论文主模型所采用的编码方式一致)。
标签 PNETSampleSet.Labels 取 0 表示原发性前列腺癌,取 1 表示转移性 / 去势抵抗性前列腺癌。
01 Syntax
SMRUCC.genomics.Analysis.HTS.P_NET.PNETSampleSet
02 Methods
| Name | Overloads | Summary |
|---|---|---|
| .ctor | 2 | 创建一个空的数据集 |
| Subset | 1 | 按照给定的下标取出一个子数据集 |
| GetFeatureVector | 1 | 取出指定样本的二值特征行 |
| Save | 1 | 把数据集写出到指定目录 |
| ToString | 1 | 生成数据集的文字描述 |
03 Properties
| Name | Overloads | Summary |
|---|---|---|
| SampleNames | 1 | 样本编号数组 |
| GeneNames | 1 | 基因名数组,其顺序必须与特征矩阵的列顺序一致 |
| Features | 1 | 特征矩阵,形状为 [样本数, 基因数 × 3] |
| Labels | 1 | 标签数组,取值为 0 或者 1 |
| Count | 1 | 样本数量 |
| InputSize | 1 | 输入特征维度,等于基因数量的 3 倍 |
| PositiveCount | 1 | 正样本(转移性 / 耐药)数量 |
| NegativeCount | 1 | 负样本(原发性)数量 |
| PositiveRatio | 1 | 正样本在数据集之中的占比 |
04 Members
#ctor
创建一个空的数据集
#ctor(
Tensor, Double(), String(), String())创建数据集
Parameters
| Name | Type | Description |
|---|---|---|
features | Tensor | 特征矩阵,形状为 [样本数, 基因数 × 3] |
labels | Double() | 标签数组 |
geneNames | String() | 基因名数组 |
sampleNames | String() | 样本名数组,取 Nothing 时自动编号 |
Subset(
Int32())按照给定的下标取出一个子数据集
Remarks
特征矩阵会被按行复制出来,因此返回的数据集与原始数据集之间不共享内存。
Parameters
| Name | Type | Description |
|---|---|---|
indices | Int32() | 样本下标数组 |
Returns
只包含指定样本的新数据集对象
GetFeatureVector(
Int32)取出指定样本的二值特征行
Parameters
| Name | Type | Description |
|---|---|---|
index | Int32 | 样本下标 |
Returns
长度为 PNETSampleSet.InputSize 的特征向量
Save(
String)把数据集写出到指定目录
Remarks
会写出两个文件:
features.csv:第一列为样本编号,其余列为基因名_mut / _amp / _del三元组;labels.csv:两列,分别为样本编号与标签。
Parameters
| Name | Type | Description |
|---|---|---|
directory | String | 输出目录,不存在时会被自动创建 |
ToString
生成数据集的文字描述
Returns
形如 Dataset[600 samples x 144 features, positive=33.00%] 的描述文本
SampleNames
样本编号数组
Returns
样本名数组
GeneNames
基因名数组,其顺序必须与特征矩阵的列顺序一致
Returns
基因名数组
Features
特征矩阵,形状为 [样本数, 基因数 × 3]
Returns
特征张量
Labels
标签数组,取值为 0 或者 1
Returns
标签数组
Count
样本数量
Returns
样本数
InputSize
输入特征维度,等于基因数量的 3 倍
Returns
特征维度
PositiveCount
正样本(转移性 / 耐药)数量
Returns
正样本数
NegativeCount
负样本(原发性)数量
Returns
负样本数
PositiveRatio
正样本在数据集之中的占比
Returns
正样本比例,位于 [0, 1] 区间内