拿到基因测序公司的原始数据后,一般是clean data又称PF data,首先要做的就是查看数据量够不够以及测序的质量怎么样,目前最为流行的数据质量查看软件就是FastQC,今天我们来介绍一下该软件的用法。
首先安装FastQC,下载地址http://www.bioinformatics.babraham.ac.uk/projects/download.html#fastqc:其实fastqc是免安装的,下载后解压缩,进入文件夹,输入命令chmod 755 fastqc,再运行。/fastqc就可以启动图文界面了,通过鼠标找到你的fastq文件,等待软件载入,结果分为如下几个部分
结果分为绿色的“PASS”,黄色的“WARN”和红色的“FAIL”。
1、Basic statistics
Total sequence代表reads数目,数据量等于reads数乘以每条reads的长度即41399965X125=5.2X109,即5.2G数据量
2、Per base sequence quality
quality就是Fred值,-10*log10(p),p为测错的概率。所以一条reads某位置出错概率为0.01时,其quality就是20。图像如上面例子,横轴代表位置,纵轴quality。红色表示中位数,黄色是25%-75%区间,触须是10%-90%区间,蓝线是平均数。
若任一位置的下四分位数低于10或中位数低于25,报“WARN”;若任一位置的下四分位数低于5或中位数低于20,报“FAIL”. 在测序早期经常会有不合格的测序reads,随着技术的发展,现在的测序质量已经非常高,以下为药明康德hiseq2500的数据质量,我们可以看到测序质量非常好。
3、Per Sequence Quality Scores
每条reads的quality的均值的分布,横轴为quality,纵轴是reads数目;
4、Per Base Sequence Content
对所有reads的每一个位置,统计ATCG四种碱基(正常情况)的分布,横轴为位置,纵轴为百分比。 正常情况下四种碱基的出现频率应该是接近的,而且没有位置差异。因此好的样本中四条线应该平行且接近。当部分位置碱基的比例出现bias时,即四条线在某些位置纷乱交织,往往提示我们有overrepresented sequence的污染。当所有位置的碱基比例一致的表现出bias时,即四条线平行但分开,往往代表文库有bias (建库过程或本身特点),或者是测序中的系统误差。
当任一位置的A/T比例与G/C比例相差超过10%,报“WARN”;当任一位置的A/T比例与G/C比例相差超过20%,报“FAIL”。
5、Per Base GC Content
对所有reads的每个位置,统计GC含量,如果建库足够均匀,reads的每个位置应当是没有差异的,所以GC含量的线应当平行于X轴,反映样品(基因组、转录组等)的GC含量。当部分位置GC含量出现bias时,往往提示我们有overrepresented sequence的污染。当所有位置的GC含量一致的表现出bias时,往往代表文库有bias (建库过程或本身特点),或者是测序中的系统误差。当任一位置的GC含量偏离均值的5%时,报“WARN”;当任一位置的GC含量偏离均值的10%时,报“FAIL”
6、Per Sequence GC Content
统计reads的平均GC含量的分布,红线是实际情况,蓝线是理论分布(正态分布,均值不一定在50%,而是由平均GC含量推断的)。 曲线形状的偏差往往是由于文库的污染或是部分reads构成的子集有偏差(overrepresented reads)。形状接近正态但偏离理论分布的情况提示我们可能有系统偏差。
偏离理论分布的reads超过15%时,报“WARN”;偏离理论分布的reads超过30%时,报“FAIL”
7、Per Base N Content
当测序仪器不能辨别某条reads的某个位置到底是什么碱基时,就会产生“N”。对所有reads的每个位置,统计N的比率,正常情况下N的比例是很小的,所以图上常常看到一条直线,但放大Y轴之后会发现还是有N的存在,这不算问题。当Y轴在0%-100%的范围内也能看到“鼓包”时,说明测序系统出了问题。当任意位置的N的比例超过5%,报“WARN”;当任意位置的N的比例超过20%,报“FAIL”。
8、Sequence Length Distribution
reads长度的分布。当reads长度不一致时报“WARN”;当有长度为0的read时报“FAIL”
9、Duplicate Sequences
统计序列完全一样的reads的频率。测序深度越高,越容易产生一定程度的duplication,这是正常的现象,但如果duplication的程度很高,就提示我们可能有bias的存在(如建库过程中的PCR duplication),横坐标是duplication的次数,纵坐标是duplicated reads的数目,以unique reads的总数作为100%。 上图的情况中,相当于unique reads数目~10%的reads是观察到两个重复的,~2%是观察到三次重复的,依此类推。
可以想象,如果原始数据很大(事实往往如此),做这样的统计将非常慢,所以fastqc中用fq数据的前200,000条reads统计其在全部数据中的重复情况。大于75bp的reads只取50bp(不知道怎么选的)进行比较。但由于reads越长越不容易完全相同(由测序错误导致),所以其重复程度仍有可能被低估。
当非unique的reads占总数的比例大于20%时,报“WARN”;当非unique的reads占总数的比例大于50%时,报“FAIL”。
备注:本文参考静渊的学习日志
来源:基因检测与解读
为你推荐
资讯 诺和诺德:司美格鲁肽“保护期”将持续至2027年4月
近日,诺和诺德全球总裁兼首席执行官杜麦克(Mike Doustdar)首度明确表态:司美格鲁肽在中国的监管数据保护将持续至2027年第二季度,届时仿制药才能开始合法进入市场。
2026-06-21 13:42
资讯 第四批全国中成药集采与第二批接续采购中选结果
近日,全国中成药联合采购办公室正式发布《关于公布全国中成药采购联盟集中采购中选结果的通知》,备受业界关注的第四批全国中成药集中带量采购及第二批接续采购中选结果尘埃落定。
2026-06-20 21:08
资讯 又是一个父亲节,关注和做好前列腺癌早期筛查
前列腺癌被称为中老年男性的隐形杀手——隐形在于早期几乎没有症状,杀手则在于部分恶性程度高的前列腺癌进展迅速,一旦发生转移,预后显著变差。
2026-06-19 14:59
资讯 低活跃预测不等于低风险,台风、飓风、强降雨和洪涝企业应做好哪些应对?
随着北半球夏季极端天气高发期到来,台风、飓风、强降雨和洪涝等风暴相关风险进入重点关注阶段。世界领先的健康和安全风险服务企业国际SOS提醒在全球运营的企业:风暴季准备的关...
2026-06-18 21:41
资讯 药石科技发布“绿色智能化学引擎”战略,强化下一代疗法CRDMO平台能力
CPHI China 2026期间,南京药石科技股份有限公司(股票代码:300725 SZ,以下简称“药石科技”)在上海举行集团战略发布会
2026-06-18 13:49
资讯 因美纳在华推出移动式生信分析解决方案,推进蛋白质组学生态合作
近日,因美纳正式推出“因美纳生信移动宝”,该生信分析解决方案采用移动式部署模式,旨在将DRAGEN™驱动的高性能算力直接送达科研与临床研究一线。同期,因美纳进一步强化其在...
2026-06-18 09:55
资讯 治疗早泄药物国内获批
6月15日,国家药监局药品批准证明文件送达信息显示,Plethora Solutions 和复星医药(600196 SH;02196 HK)联合申报的 5 1 类药物利多卡因丙胺卡因气雾剂获批上市,此为...
2026-06-17 21:36
资讯 武田制药公布Oveporexton新关键性研究数据
在第40届美国联合专业睡眠学会年会(SLEEP 2026)上公布的3期研究次要及探索性终点结果进一步显示,Oveporexton在广泛的日间及夜间症状方面带来改善
2026-06-16 12:58
资讯 兆科眼科硫酸阿托品滴眼液澳洲上市注册申请获受理
6月15日,兆科眼科发布公告称,公司就其用于减慢儿童近视加深疗法的硫酸阿托品滴眼液(0 02%剂量,产品代码:NVK002)提出的注册申请已获澳洲Therapeutic Goods Administrati...
2026-06-16 10:53
资讯 和铂医药和百图生科宣布联合成立AI医药公司
6月15日,和铂医药和百图生科联合宣布,双方将建立全面战略合作伙伴关系,联合创立一家面向全球市场的新型AI管线研发公司MegaStream Techbio。
2026-06-16 10:25
资讯 陪审团认定安进故意侵权,和铂医药最高可获6060万美元赔偿
今日,和铂医药(02142 HK)发布公告,美国特拉华州联邦地区法院的陪审团就和铂医药针对安进公司(Amgen Inc )及其子公司Teneobio, Inc (以下合称“安进”)提起的专利侵...
2026-06-15 21:28
资讯 年内创新药上市企业最大回购计划
港股上述企业,中国生物制药(正大天晴为其旗下公司)今日发布公告,2026年6月12日,公司董事会决议通过一项股份购买计划,将视市场情况于未来12个月以不超过20亿港元总价在公开...
2026-06-15 15:56




















