Transcription Start Sites Annotation Regime(TSSAR): 基于 dRNA-seq 数据的转录起始位点注释算法。
TSSAR
00 Remarks
本实现为论文(Amman et al., BMC Bioinformatics 2014)与原始 TSSAR.pl/R 工作流的纯 VB.NET 重写,核心步骤为:
- 从 [+] / [-] 两个 SAM 文库统计双链逐位置 read 起始覆盖度;
- 在滑动窗口(默认 1000 nt)内用零膨胀 Poisson 回归估计局部背景, 分离"结构零(不转录)"与"采样零(转录但未采到)";
- 对 [+] 与 [-] 的逐位置计数差使用 Skellam 分布做显著性检验;
- 多个窗口的 p 值取几何平均,并以双阈值(p 值 + 噪声阈值)判定 TSS;
- 可选多重检验校正、连续 TSS 聚类、基因上下文分类与 5'UTR / TEX 评估。
01 Syntax
SMRUCC.genomics.Analysis.RNA_Seq.TSSAR.TSSAR
02 Methods
| Name | Overloads | Summary |
|---|---|---|
| Annotate | 1 | 执行一次完整的 TSS 注释分析。 |
| AnnotateCommand | 1 | 执行一次完整的 TSS 注释分析,并把 TSS 与未建模区域写出为 BED 文件。 |
03 Members
Annotate(TssarOptions)
执行一次完整的 TSS 注释分析。
Parameters
| Name | Type | Description |
|---|---|---|
options | TssarOptions | 运行参数。 |
Returns
分析结果。
AnnotateCommand(
String, String, Int32, String, String, String, String, Int32, Int32, Double, String, Int32, Boolean, String, Boolean, String)执行一次完整的 TSS 注释分析,并把 TSS 与未建模区域写出为 BED 文件。
Remarks
用法示例:
TSSAR.Annotate --libP plus.sam --libM minus.sam --g_size 5000000 --minPeak 3 --pval 1e-4 --winSize 1000 --score d --mtc fdr --ptt genome.ptt --out tss.bed --dump Dump.bedParameters
| Name | Type | Description |
|---|---|---|
plusSam | String | [+] 文库的 SAM 文件路径。 |
minusSam | String | [-] 文库的 SAM 文件路径。 |
genomeSize | Int32 | 基因组长度(当提供 fasta 时可省略)。 |
fasta | String | 参考基因组 fasta 文件路径。 |
out | String | 输出的 TSS BED 文件路径。 |
dump | String | 输出的未建模区域 BED 文件路径。 |
ptt | String | 基因注释(PTT)文件路径。 |
windowSize | Int32 | 滑动窗口大小。 |
minPeak | Int32 | 噪声阈值。 |
pvalue | Double | p 值阈值。 |
score | String | 评分模式( |
range | Int32 | 聚类合并的最大间距。 |
nocluster | Boolean | 是否禁止聚类( |
mtc | String | 多重检验校正方法;为空表示不校正。 |
prorata | Boolean | 是否按 |
chrName | String | 输出 BED 中使用的参考序列名称。 |
Returns
被注释的 TSS 数量。