#article-container td,#article-container th{white-space:normal;overflow-wrap:anywhere}#article-container td:first-child,#article-container th:first-child{width:22%}
论文题名: The human splicing code reveals new insights into the genetic determinants of disease
期刊与年份: Science,2015。论文原文。
范围为正文全部编号主图及其子 ...
#article-container td,#article-container th{white-space:normal;overflow-wrap:anywhere}#article-container td:first-child,#article-container th:first-child{width:22%}
论文题名: Predicting effects of noncoding variants with deep learning–based sequence model
期刊与年份: Nature Methods,2015。论文原文。
范围为正文全部编号主图及 ...
刚接触转录组分析时,最容易被大量工具名称淹没。与其先背命令,不如先理解数据在每一步发生了什么变化。
1. FASTQ:测序仪输出的读段FASTQ 文件通常以四行为一组记录一条 read:
1234@read_001AGCTTAGCTA+FFFFFFFFFF
四行依次对应 read 标识、碱基序列、分隔符和质量字符。质量字符经过编码后表示每个碱基被正确识别的可信程度。
这一阶段最重要的问题不是“有多少文件”,而是:
数据是单端还是双端;
每个样本对应哪些文件;
read 长度是否一致;
接头和低质量碱基是否明显;
是否存在异常的碱基组成或重复序列。
2. 质控:先判断数据能不能用质控报告是 ...
生物信息学
未读质控不是在报告里寻找绿色对勾,而是在分析开始前识别风险。一个指标是否异常,要放回具体数据类型和样本背景中解释。
先看整体,再看局部我习惯按三个层次阅读质控结果:
单个样本是否完整:文件大小、read 数、质量和长度是否合理;
样本之间是否一致:同批样本的分布是否大体接近,有没有明显离群值;
异常是否影响下游问题:警告来自技术问题,还是数据本身的合理特征。
每碱基质量测序 read 末端质量轻微下降很常见。需要关注的是下降发生得多早、影响多少碱基,以及是否在大量样本中重复出现。
不要为了得到一张“全绿”的报告而过度修剪。过度截短会损失有效信息,也可能降低后续比对或组装能力。
GC 含量GC ...
Linux 命令行的核心并不是记忆大量命令,而是理解三件事:我在哪里、我要操作什么、结果要去哪里。
认识当前目录123pwdlsls -lah
pwd 显示当前路径;ls 列出目录内容;-l 显示详细信息,-a 包含隐藏文件,-h 将文件大小显示为更容易阅读的单位。
路径分为两类:
绝对路径从根目录 / 开始;
相对路径从当前目录开始,. 表示当前目录,.. 表示上一级目录。
创建、复制和移动1234mkdir practicetouch practice/notes.txtcp practice/notes.txt practice/notes-copy.txtmv practice/ ...
Linux 的力量来自组合:一个命令只做好一件事,再用管道把多个命令连接起来。
标准输入与标准输出大多数命令从标准输入读取内容,把正常结果写到标准输出,把错误信息写到标准错误。
123command > result.txtcommand >> result.txtcommand 2> error.log
> 覆盖文件,>> 追加文件。重定向前应确认目标文件,避免无意覆盖重要结果。
用管道组合命令管道符 | 会把左侧命令的输出交给右侧命令:
1grep -v '^#' records.txt | sort | uniq -c | ...
深度学习代码看起来有很多模块,但一次训练迭代通常只包含五件事:准备数据、前向传播、计算损失、反向传播、更新参数。
张量:模型处理的数据张量可以理解为带有多个维度的数值数组。一个批次的输入常见形状是:
1[batch_size, features]
图像任务中则常见:
1[batch_size, channels, height, width]
很多初学错误并非模型原理错误,而是张量形状、数据类型或所在设备不一致。
前向传播模型接收输入并产生预测:
1pred = model(x)
神经网络中的每一层都对输入进行一次可微分变换。层数更多并不自动意味着效果更好,结构要与数据规模和问题复杂度匹 ...
一个模型在训练集上表现很好,并不代表它学会了可以迁移的规律。它也可能只是记住了训练样本。
三种数据划分的职责
训练集用于更新模型参数;
验证集用于选择模型、调整超参数和决定何时停止;
测试集只用于最后一次相对独立的评估。
如果反复根据测试集结果调整模型,测试集实际上已经参与了训练决策,最终指标会过于乐观。
如何识别过拟合典型现象是训练损失持续下降,而验证损失停止下降甚至开始上升。也可能表现为训练指标远高于验证指标。
可以同时画出两条曲线:
12345plt.plot(train_loss, label="train")plt.plot(valid_loss, label= ...
方法分享
未读可复现并不等于一开始就搭建复杂的平台。对公开练习和个人学习,先把输入、代码、结果和环境分开,已经能避免大量返工。
一个够用的目录123456project/├─ data/├─ scripts/├─ results/├─ figures/└─ README.md
让每张图都能追溯每张公开示例图都应该能追溯到脚本、数据版本和关键参数。
记录“为什么”代码能说明做了什么,README 应继续说明为什么这么做。







