nuget server logo nuget api documents
↑

API Docs / SMRUCC.genomics.Analysis.HTS.P-NET / PNETSampleSet

PNETSampleSet

Full name SMRUCC.genomics.Analysis.HTS.P_NET.PNETSampleSet Assembly SMRUCC.genomics.Analysis.HTS.P-NET Members 15

P-NET 的样本数据集

00 Remarks

特征矩阵 PNETSampleSet.Features 的形状为 [样本数, 基因数 × 3], 其中每一个基因按顺序占用 3 列,依次为体细胞突变、拷贝数扩增、拷贝数缺失, 取值均为 0 或者 1 的二值变量(只保留高水平扩增与深缺失的两态编码, 与论文主模型所采用的编码方式一致)。

标签 PNETSampleSet.Labels 取 0 表示原发性前列腺癌,取 1 表示转移性 / 去势抵抗性前列腺癌。

01 Syntax

SMRUCC.genomics.Analysis.HTS.P_NET.PNETSampleSet

02 Methods

NameOverloadsSummary
.ctor 2 创建一个空的数据集
Subset 1 按照给定的下标取出一个子数据集
GetFeatureVector 1 取出指定样本的二值特征行
Save 1 把数据集写出到指定目录
ToString 1 生成数据集的文字描述

03 Properties

NameOverloadsSummary
SampleNames 1 样本编号数组
GeneNames 1 基因名数组,其顺序必须与特征矩阵的列顺序一致
Features 1 特征矩阵,形状为 [样本数, 基因数 × 3]
Labels 1 标签数组,取值为 0 或者 1
Count 1 样本数量
InputSize 1 输入特征维度,等于基因数量的 3 倍
PositiveCount 1 正样本(转移性 / 耐药)数量
NegativeCount 1 负样本(原发性)数量
PositiveRatio 1 正样本在数据集之中的占比

04 Members

method .ctor #
#ctor

创建一个空的数据集

method .ctor overload 2 #
#ctor(Tensor, Double(), String(), String())

创建数据集

Parameters
NameTypeDescription
featuresTensor

特征矩阵,形状为 [样本数, 基因数 × 3]

labelsDouble()

标签数组

geneNamesString()

基因名数组

sampleNamesString()

样本名数组,取 Nothing 时自动编号

method Subset #
Subset(Int32())

按照给定的下标取出一个子数据集

Remarks

特征矩阵会被按行复制出来,因此返回的数据集与原始数据集之间不共享内存。

Parameters
NameTypeDescription
indicesInt32()

样本下标数组

Returns

只包含指定样本的新数据集对象

method GetFeatureVector #
GetFeatureVector(Int32)

取出指定样本的二值特征行

Parameters
NameTypeDescription
indexInt32

样本下标

Returns

长度为 PNETSampleSet.InputSize 的特征向量

method Save #
Save(String)

把数据集写出到指定目录

Remarks

会写出两个文件:

  • features.csv:第一列为样本编号,其余列为 基因名_mut / _amp / _del 三元组;
  • labels.csv:两列,分别为样本编号与标签。
Parameters
NameTypeDescription
directoryString

输出目录,不存在时会被自动创建

method ToString #
ToString

生成数据集的文字描述

Returns

形如 Dataset[600 samples x 144 features, positive=33.00%] 的描述文本

property SampleNames #
SampleNames

样本编号数组

Returns

样本名数组

property GeneNames #
GeneNames

基因名数组,其顺序必须与特征矩阵的列顺序一致

Returns

基因名数组

property Features #
Features

特征矩阵,形状为 [样本数, 基因数 × 3]

Returns

特征张量

property Labels #
Labels

标签数组,取值为 0 或者 1

Returns

标签数组

property Count #
Count

样本数量

Returns

样本数

property InputSize #
InputSize

输入特征维度,等于基因数量的 3 倍

Returns

特征维度

property PositiveCount #
PositiveCount

正样本(转移性 / 耐药)数量

Returns

正样本数

property NegativeCount #
NegativeCount

负样本(原发性)数量

Returns

负样本数

property PositiveRatio #
PositiveRatio

正样本在数据集之中的占比

Returns

正样本比例,位于 [0, 1] 区间内