尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

家系与肿瘤全外显子组分析实战:从FASTQ到临床报告的核心流程与参数解析

发布时间:2026/9/26 23:44:17

资讯中心
01
ARTICLE

家系与肿瘤全外显子组分析实战:从FASTQ到临床报告的核心流程与参数解析

家系与肿瘤全外显子组分析实战:从FASTQ到临床报告的核心流程与参数解析
2026年3月这场实战课我算是第一批报名的人。做NGS数据分析这些年单样本、简单家系、肿瘤配对都跑过但像这次这样把家系和肿瘤临床基因组/外显子组分析从头到尾完整串起来、还是用真实样本数据演练的机会确实不多。三天高强度下来很多以前零散的经验都被重新梳理了一遍尤其是家系遗传模式筛选和肿瘤低频突变识别这两条线流程上同源分析逻辑却差得很远。这篇就把整个实战过程、核心参数、我踩过的坑和现场学员问得最多的问题一次性写清楚。不管你是刚入行的生信新手还是已经有几年NGS分析经验但只熟悉其中一条线的同行这篇文章应该都能帮你把外显子组数据分析的拼图补完整。1. 项目整体定位与流程设计1.1 家系分析和肿瘤分析到底是不是一回事先说结论底层流程相似分析逻辑完全两回事。这是这次实战课最核心的一个认知刷新点。家系外显子组分析目标是找遗传性疾病的致病基因变异。常见场景是孩子患病父母正常或者一家人里多个成员患病要找出哪个变异跟疾病表型是共分离的。因为遗传病变异通常是生殖系突变germline mutation理论上应该在全身体细胞里都存在所以样本来源可以是外周血、唾液或者干血斑。分析上强调孟德尔遗传规律要判断变异是显性遗传还是隐性遗传是常染色体还是性染色体还特别在意变异是不是和疾病表型在家族成员中严格共分离。肿瘤外显子组分析就不一样了目标是找肿瘤组织里的体细胞突变somatic mutation也就是肿瘤细胞特有的、正常组织里没有的突变。样本通常是肿瘤组织加癌旁正常组织配对或者外周血配肿瘤。体细胞突变频率往往很低可能只有百分之一到百分之几而且肿瘤组织本身还高度异质不同亚克隆的突变频率不一样。分析上不仅要找变异还要做拷贝数变异CNV、肿瘤纯度purity估算、克隆结构推断最后关联到驱动基因和靶向用药。打个比方家系分析像是在全家人里排查一个祖传的“问题基因”只要找到那个在所有患者身上都存在、非患者身上都没有的变异基本就破案了肿瘤分析则像是在一堆混着正常细胞和肿瘤细胞的样本里找出肿瘤细胞特有的“犯罪标记”还要搞清楚是哪几个克隆团伙干的。1.2 流程的总体架构从FASTQ到临床报告不管家系还是肿瘤外显子组分析的大脉络是一致的。实战课第一天就把全流程拉了一遍我这里按实际操作顺序整理出来原始数据质控用FastQC检查FASTQ质量看碱基质量分布、GC含量、接头污染、重复序列比例。这一步决定数据能不能用、要不要裁剪。序列比对到参考基因组主流工具是BWA-MEM输出SAM/BAM文件。比对这一步最耗时也是后面所有分析的基础。比对后处理用samtools排序、Picard或GATK MarkDuplicates去重、GATK Base Quality Score RecalibrationBQSR校正碱基质量值产出分析就绪的BAM。变异检测家系和肿瘤在这里分叉。家系用GATK HaplotypeCaller一般多个样本joint calling肿瘤用GATK Mutect2做肿瘤-正常配对分析。变异注释用VEP或ANNOVAR注释变异的位置、类型、氨基酸改变、已知数据库频率gnomAD等、致病性数据库ClinVar等、预测软件有害性评分。变异筛选和解读家系按遗传模式和共分离过滤肿瘤按体细胞证据、驱动基因、用药关联过滤最终人工核查IGV。报告撰写把候选变异、证据链、ACMG/PGx分级或用药建议整理成临床报告。这个流程每一步都不难难的是每一步都做对、做到位、知道为什么。1.3 本次实战使用的数据与参考基因组实战课用的数据是去标识化的真实样本。家系案例是一对父母加一个患病男孩trio怀疑某种神经发育类疾病之前做过单基因panel阴性所以上了全外显子组。肿瘤案例是一个肺腺癌患者的肿瘤组织和癌旁正常组织配对用来演示驱动基因识别和靶向用药相关的变异注释。参考基因组用的是GRCh38hg38。这一点值得强调现在很多数据库和工具都已经全面兼容hg38临床上也逐渐从hg19迁移到hg38如果你还在用hg19建议尽早切换避免在坐标转换上浪费时间和出错概率。外显子组分析用的靶区域家系和肿瘤用的都是全外显子捕获试剂盒对应的大约30-50Mb区域各家试剂盒的具体区间文件BED略有差异但分析流程一样。2. 环境搭建与核心工具选型2.1 计算环境怎么搭不会坑先说硬件建议实测下来外显子组项目对内存的要求主要卡在比对和HaplotypeCaller这两个环节。BWA-MEM比对时每个样本消耗大概10-20GB内存如果你用多个线程精心调度一个trio可以同时跑但需要40GB以上内存才舒服。GATK HaplotypeCaller单样本模式耗内存大约5-10GB但joint calling多个样本时内存需求会上升Mutect2配对模式也要准备充足内存尤其是加上肿瘤样本有拷贝数变异时。实战课上我们统一用的是Ubuntu 22.04云服务器32核、128GB内存跑完整个trio和肿瘤配对全流程非常顺畅。软件环境我用的是Miniconda加conda-forge和bioconda频道一行一条命令简洁干净conda create -n wes python3.10 conda activate wes conda install -c bioconda -c conda-forge bwa samtools picard gatk4 vep fastqc multiqc如果公司或团队有条件强烈建议用Docker镜像比如broadinstitute/gatk官方镜像里面有全套GATK工具和配套环境省去版本兼容性问题。GATK版本这次用的是4.5.x和以前3.x版本命令差异较大资料丰富的网上教程多教GATK4但如果你看到旧教程千万别照抄。2.2 核心工具和参数背后的逻辑工具选型其实没有太多悬念业界事实标准就是这么一套BWA-MEM做比对默认参数即可但务必加-M标记以兼容Picard下游处理。关键参数是-t线程数我设了16线程比对速度明显提升。GATK MarkDuplicates去重我倾向于用Picard的版本。对WES来说去重是为了避免PCR扩增带来的重复读段干扰变异频率计算。注意这里不是像RNA-seq分析那样直接删掉重复而是标记下游分析时自动忽略。GATK BQSR碱基质量值校正。这一步新手最容易忽略。它做的事情是重新校准每个碱基的Phred质量分数让质量值反映真实的错误率。很多测序仪的系统误差如果不校正后面的变异检测会在特定位点出现大量假阳/假阴性。做家系和肿瘤都建议执行GATK官方管线中这一步是标配。家系变异检测用GATK HaplotypeCaller。它通过局部组装的方法确定每个候选区段的单倍型再比对读段到单倍型能有效处理小片段插入缺失indel和复杂变异比旧版UnifiedGenotyper敏感得多。参数上我用了--emit-ref-confidence GVCF输出中间文件多个样本合并时再执行GenomicsDBImport和GenotypeGVCFs做joint calling。肿瘤变异检测用GATK Mutect2。它的核心特点是需要提供正常的样本通常是配对正常组织或外周血用正常的等位基因频率作为背景噪声模型这样能够过滤掉生殖系突变和测序噪声保留真正意义上的体细胞突变。参数上关键的是--germline-resource指定人群生殖系多态性数据库比如gnomAD的等位基因频率文件还有--panel-of-normals指定一组正常样本构建的背景突变库。实战里我们没构建panel of normals用默认模式也能跑但要知道真实临床项目里这个很重要。2.3 参考基因组和数据库的准备用hg38需要下载全套配套文件包括hg38.fa、对应索引文件.bwa、.dict、.fai、dbSNP基于hg38的vcf、gnomAD基于hg38的vcf、ClinVar的hg38版、Mills和1000G的indel训练集、HapMap和OMNI的snp标签集用于BQSR和VQSR。这些文件加起来几个GB到几十GB不等下载时间视网速而定建议提前准备。实战中我们用了GATK bundle提供的hg38资源包路径gs://gatk-best-practices/hg38下载到本地后统一放在一个目录里后面每个环节都引用。我个人习惯用软链把路径简化省得每次输入长路径。VEP的缓存也要提前下载并解压否则注释环节会非常慢还容易卡在缓存缺失的报错上。注意数据库版本一定要和参考基因组版本一致。hg38的数据库就不要用在hg19的项目里反之亦然。坐标和等位基因可能不一样这直接导致注释结果错误。3. 家系外显子组分析实操3.1 标准化处理从FASTQ到GVCF实战第一天的任务就是把三个家系成员先证者、父亲、母亲的FASTQ数据走完标准GATK管线这一步没有分析判断按规矩执行就行。整个过程中的每一步都要关注QC中间输出而不是盲目往下跑。比对命令bwa mem -M -t 16 -R RG\tID:child\tSM:child\tPL:ILLUMINA\tLB:lib1 hg38.fa child_R1.fastq.gz child_R2.fastq.gz | samtools sort - 16 -m 2G -o child.sorted.bam -这里的-R指定Read Group信息特别关键SM标签样本名必须和文件名约定一致后续GATK按样本名识别样本LB标记文库PL标记测序平台。漏掉这个后面去重、覆盖度统计都不知道你哪个样本是哪个。每个样本都要保证RG唯一。去重和BQSRgatk MarkDuplicates -I child.sorted.bam -O child.dedup.bam -M child.metrics.txt gatk BaseRecalibrator -R hg38.fa -I child.dedup.bam --known-sites dbSNP.vcf.gz --known-sites Mills_indels.vcf.gz -O child.recal.table gatk ApplyBQSR -R hg38.fa -I child.dedup.bam --bqsr-recal-file child.recal.table -O child.recal.bam注意MarkDuplicates的两个输出去重后BAM和指标文件。指标文件里有PERCENT_DUPLICATIONWES文库这个值一般在5%~20%之间。如果超过30%说明建库PCR循环过多或者模板量不足虽然数据还能分析但你要警惕过度重复带来的有效测序深度下降。要验证BQSR的效果可以对比BaseRecalibrator在你重校准后的BAM上跑出来的质量分数差理想状态是几乎没有系统性偏差。实战中我们只跑了base-level的QC日常项目如果时间紧也会跳过这部分但千万别连BQSR本身都跳了。然后HaplotypeCaller在每个样本上跑GVCF模式gatk HaplotypeCaller -R hg38.fa -I child.recal.bam -O child.g.vcf.gz -ERC GVCF gatk HaplotypeCaller -R hg38.fa -I father.recal.bam -O father.g.vcf.gz -ERC GVCF gatk HaplotypeCaller -R hg38.fa -I mother.recal.bam -O mother.g.vcf.gz -ERC GVCF合并并联合基因分型joint callinggatk GenomicsDBImport -R hg38.fa -V child.g.vcf.gz -V father.g.vcf.gz -V mother.g.vcf.gz --genomicsdb-workspace-path trio_db -L target_regions.bed gatk GenotypeGVCFs -R hg38.fa -V gendb://trio_db -O trio.vcf.gzGenomicsDBImport比较吃I/O如果只是纯trio也可以直接上CombineGVCFs但GenomicsDB的优势是可扩展样本多的时候也一样顺。实战中我们都用的GenomicsDB虽然只有3个样本但练一遍是对的。3.2 家系遗传模式筛选与共分离分析从这个环节开始分析就从“跑流程”进入了“破案模式”。拿到trio.vcf.gz之后我用bcftools做初步过滤。先按常见的质量控制标准把公认的垃圾位点过滤掉QUAL30、DP8、GQ20。但也要注意别一刀切有些致病位点因为序列复杂度原因天然难以测序覆盖率可能就是偏低后面需要用IGV人工确认。过滤命令大致这样bcftools filter -e QUAL30 || DP8 || GQ20 trio.vcf.gz | bcftools view -f PASS -o trio.clean.vcf.gz然后才是家系分析的核心按孟德尔遗传模式筛选候选变异。这里有几种情况要分开看。常染色体显性遗传AD模型要求先证者携带变异通常是杂合患病父母也携带如果是新发突变de novo则父母都不携带正常成员不携带或不受影响。在trio里最常见的是de novo模式——父母都正常先证者携带一个新发杂合突变这在一些神经发育疾病里比例很高。实战案例恰好明显符合这个方向。常染色体隐性遗传AR模型要求先证者是两个不同变异的复合杂合compound heterozygous或者同一个变异的纯合状态父母各携带一个杂合变异自身不发病。X连锁遗传男性患者半合子、女性携带者杂合还可能是新发需要结合先证者性别和家族史判断。实战课上演示了一个经典的筛选路径用bcftools或VEP注释结果先过滤掉人群频率过高的多态性位点——比如gnomAD总等位基因频率大于0.001的直接剔除因为真正的罕见病致病变异在普通人群里几乎不可能以1/1000的频率传播然后按de novo模型做候选父母在相同位点都是纯合参考基因型或杂合不达标先证者杂合且reads支持度符合基因型。用bcftools view -i CHILD[0]het FATHER[0]ref MOTHER[0]ref这类索引条件就能快速筛出来配合Python脚本辅助做基因型逻辑判断也行。实测下来一个trio过滤完频率和genotype条件之后剩下的候选SNV/indel一般是从几十万掉到十位数级别运气好可能只剩几个到几十个这时候结合表型、基因功能、已知疾病关联很容易锁定目标。但这一步务必注意人群频率阈值要根据疾病遗传模式调整。AR模型频率阈值可以参考gnomAD等位基因频率但如果是隐性遗传病杂合携带者频率可能并不低也不能因为“gnomAD里有0.0005的杂合”就一票否决要抓住纯合/复合杂合状态。3.3 候选变异注释和致病性评估候选变异出来后用VEP加上一句命令就完成大量基础注释vep -i candidates.vcf --format vcf --species homo_sapiens \ --assembly GRCh38 --cache --offline --symbol --canonical \ --biotype --af_gnomad --clinvar --hgvs --plugin LoFtool \ -o candidates.annotated.vcf这里面--af_gnomad会注释上gnomAD的等位基因频率--clinvar会关联ClinVar的既有评级--hgvs输出HGVS规范的蛋白变更描述。我还会加上SIFT、PolyPhen-2、CADD等预测工具不同机构习惯不同但目的都一样为ACMG评级提供证据。ACMG/AMP评级标准也就是2015年发布的那个系统把变异按致病性分成致病P、可能致病LP、意义未明VUS、可能良性LB、良性B五级。评级是基于多维度证据综合判断人群频率PM2/BS1等、蛋白功能预测PVS1/PS1等、患者的等位基因状态与疾病遗传模式吻合PM3/PP1等、既往数据库记录BA1/PP3等、家系共分离PP1等每一项都有代码最后综合成等级。这次实战最后锁定的de novo候选变异需要同时满足几个条件在已知疾病基因上、人群频率极低或缺失、蛋白功能影响严重比如无义突变导致蛋白截短、父母双方基因型正常。如果你需要把这个变异报告出去就还需要做一次Sanger测序验证确认NGS结果无假阳尤其是de novo变异。临床上这一步基本是必须的从实验室试剂准备到报告出来大概一周。提醒一下不要试图用机器自动代替ACMG评级的人工判断。评级需要结合临床表型、遗传方式、基因特异性的信息算法只能辅助打分最终判断一定得是人做出来。4. 肿瘤临床基因组/外显子组分析实操4.1 肿瘤配对样本处理和Mutect2实战肿瘤WES分析样本逻辑完全不同。你拿到的通常是肿瘤组织和配对正常组织两个FASTQ。正常样本既可以是癌旁组织也可以是外周血不管来源是什么它的作用都是给Mutect2当参考基线帮它把体细胞突变和生殖系突变区分开。同样的预处理步骤先跑一遍BWA-MEM比对、MarkDuplicates去重、BQSR。这里有一点特别重要肿瘤分析时比对、去重、BQSR每个样本单独做没有错但一定不能跳过质控因为肿瘤样本的测序质量往往比正常样本波动更大。Mutect2配对模式命令gatk Mutect2 -R hg38.fa \ -I tumor.recal.bam -tumor TB \ -I normal.recal.bam -normal NB \ --germline-resource gnomAD.vcf.gz \ --af-only-germline \ -O somatic.vcf.gz这里-tumor和-normal后面跟的必须和BAM的SM标签严格一致就是你在添加RG时写的样本名否则Mutect2直接报错或得到空结果。测试过一次把名字写错结果所有变异都被判定为正常样本中存在输出完全被清洗了。出vcf后还不能直接用要执行两个过滤步骤gatk FilterMutectCalls -R hg38.fa -V somatic.vcf.gz --contamination-table contamination.table -O somatic.filt.vcf.gz--contamination-table是EstimatingContamination输出的文件用来估计肿瘤样本里面混入的正常细胞比例并做修正。没有这个表也能跑但结果可信度要打折扣。过滤后的VCF里会有PASS位点才算通过。4.2 体细胞突变的注释和驱动基因识别肿瘤变异注释不能照搬家系的VEP参数它需要额外整理一些肿瘤相关的数据库信息比如变异在COSMIC里出现过没有、在CIViC和OncoKB里的用药注释、是否落在已知的癌症驱动基因Cancer Gene Census等上。VEP同样可以完成大部分工作只需要按需加上--custom指向数据库文件和额外的插件参数。用VEP注释完后我的习惯是再用Python脚本过滤一遍只保留带有PASS标记的位点优先关注外显子和剪接位点的变异优先关注在驱动基因列表内的变异过滤掉同义突变silent过滤掉在正常样本里也有较高支持度的候选生殖系变异保留VAF大于某个阈值的变异这个阈值依赖样本纯度但一般大于0.02-0.05比较可信关于VAF阈值肿瘤WES测序深度相近时低VAF的突变有几大挑战。第一个是测序极限紧跟ULOUnique Molecular Index捕获效率第二个是组织细胞纯度低。实战里我们的肿瘤样本纯度约70%那么一个真正的杂合体细胞突变理论上VAF应该在35%左右如果样本纯度只有30%对应VAF就会掉到15%再低就容易被当成噪声。Mutect2使用正常配对能抑制大量假阳但漏检低VAF突变这事谁都避免不了所以解读时一定要结合样本的肿瘤纯度去评估VAF的合理性。用药关联分析方面OncoKB、《NCCN指南》、CIViC这些都是权威来源。肿瘤报告里通常要标注变异对应的靶向药物和级别比如“EGFR c.2573TG p.L858R对应EGFR-TKI敏感证据级别1A”。做基因型-表型关联时别只看单个点突变还要注意拷贝数变异、基因融合、MSI状态等但全外显子组的MSI检测效果不如专用panel通常需要额外的软件和算法来完成这一点实践中要心里有数。4.3 肿瘤异质性和克隆结构推断这部分是很多公开教程不会讲但临床上越来越重要的内容。肿瘤不是铁板一块它可能有多个亚克隆每个亚克隆携带不同的突变组合。VAF分布往往呈现若干个峰一个主克隆的变异VAF偏高比如接近纯度修正期望值若干亚克隆的变异VAF偏低。通过VAF聚类、等位基因特异性拷贝数状态校正之后你可以大致推断主克隆和亚克隆的比例这是肿瘤演化分析的基础对用药后耐药机制判断也有帮助。工具方面PyClone、SciClone经常出现但这类工具严重依赖样本纯度、拷贝数背景和位点VAF的精确性。实战课演示了一个轻量级的思路把Mutect2输出的VAF按照变异类别非同义、无义、剪接等分组绘制VAF分布直方图和聚类图。如果看到一个清晰的高峰说明样本整体相对均一如果出现多个低峰说明存在亚克隆。对大多数临床应用来说这个程度已经足够提供参考了。我拿实战数据跑出来果然有主克隆峰和几个低VAF的尾巴提示可能有亚克隆结构。后来查了病理报告显示肿瘤有中等程度异质性这算是NGS结果跟病理的相互印证。有一点要记住WES的亚克隆推断只是拍快照它给的是当时取样的“混合状态”不等于肿瘤的全部历史。5. 全流程质控速查、报告要点与常见问题排查5.1 质控指标速查哪些数字必须盯我整理了一个实战速查表做完每个样本先过一遍这列指标发现问题早行动比事后返工强得多质控项参考范围/建议备注平均测序深度WES家系正常样本不小于100x肿瘤不小于200x深度的分母是扣掉异常读段后的映射到靶区域的reads靶区域覆盖度20x比例家系不小于95%肿瘤靶区建议更高低于90%要考虑样本是否污染或捕获失败duplication rate5%~20%过高说明建库或扩增环节有问题Q30比例大于80%越高越好FastQC/MultiQC直接读实测插入片段大小250~400bp严重偏离会影响变异检测Ti/Tv比全外显子约2.5~3.0明显偏离说明变异检测质量异常家系孟德尔一致性错误率全外显子约2.5~3.0明显偏离说明变异检测质量异常dbSNP占比全外显子约2.5~3.0明显偏离说明变异检测质量异常Contamination估计5%用GATK EstimateContamination或VerifyBamID查孟德尔一致性错误率这个点值得单独强调。家系样本联合分析时很多软件会报出样本间的亲子关系验证结果。我见过因为样本标签写反导致整个项目返工的情况父亲和母亲的样本名字互换孟德尔一致性几乎处处报错当时花了一晚上查到底哪步出了问题最后用samtools统计SNP做亲缘关系比对才发现。做家系项目第一步就该用bcftools query跑一下位点基因型做个简单的亲缘验证防患于未然。5.2 常见问题排查实录这次实战课现场和后续答疑里几个高频问题很典型我挑出来跟大家分享问题一一个家系关键位点里孩子是杂合父亲是杂合母亲是纯合参考这符合常显遗传吗这其实是一个陷阱题。如果家系里父亲患病孩子也患病那么孩子遗传了父亲的突变是符合AD遗传的。但如果孩子是新发突变父母都不患病那就完全看IGV和覆盖度。之后要看人群频率和变异致病性才能判断该不该报告。还有一个常见错误是把父母的Genotype用错了有时候因为覆盖不足父母在致病位点上被GATK判成了参考纯合但实际是杂合漏检这时候要回IGV看reads支持和覆盖深度NG数据不足时要考虑增加靶向Sanger验证或其他方法补位。问题二Mutect2结果里CNV相关区域出现大量低频变异怎么办这是肿瘤分析常见现象。拷贝数变异会影响某个区域的等位基因频率尤其当某个染色体区段发生扩增时突变VAF会被稀释或抬高甚至导致真实存在的突变被误判成不存在。遇到这种区域建议结合纯度和拷贝数状态一起解读或者局部使用更加保守的过滤条件。有条件可以做浅全基因组测序sWGS补一个CNV谱对临床决策帮助很大。问题三BAM文件比对率低原因在哪比对率低先看有没有接头残留、测序读长与参考基因组不匹配、样本是不是混入了其他物种比如支原体污染在肿瘤样本里很要紧。用FastQC或MultiQC看序列分类比例用Kraken2一类的工具快速检测微生物污染都是排查手段。很多时候问题出在参考基因组版本选错了hg19和hg38混用比对率骤降。问题四ClinVar显示“conflicting interpretations of pathogenicity”怎么办这不是软件问题是临床解读里的常态。同一个变异某个实验室可能报告“致病”另一个报告“VUS”这是不断累积的证据导致的。实际处理时要自己看证据来源、等位基因频率、功能实验综合判断你手头的病例到底更支持哪个方向。把最新ClinVar版本里的评级完整保留在注释文档里也是报告溯源的一部分。5.3 报告撰写和临床沟通注意事项分析最后一步是出报告这一块看似简单实际最容易出问题。我的体会是报告能不能交出去关键看三点信息可溯源。每个变异都要写明证据来源哪个数据库、哪个版本、哪条文献。这样接收报告的遗传咨询师或临床医生可以复核。结论明确不模棱两可。ACMG评级是“可能致病”就是“可能致病”不要再加“可能是”之类的多余解释。报告格式严格但结论清晰。区分临床建议与研究建议。如果变异评级是VUS不建议直接作为用药依据可以做进一步的家系检测、功能实验或者肿瘤panel补充验证。要列清楚下一步可执行的动作但不越俎代庖给治疗方案。现场学员问得最多的问题是VUS到底该不该报我的观点是C级不明VUS在临床上很常见只要证据链清晰就可以作为参考写在“发现”一栏但必须明确标注VUS等级并解释当前证据支持的强度和缺口。真正不能做的是直接跳过ACMG评级口头“猜”一个结论这种模糊处理最容易出纠纷。5.4 时间规划和硬件配置参考项目实战课结束时大家都关心真项目需要多少资源和时间。给一个粗略参考单样本WES数据量通常8-10G fastq32核机器从FASTQ到最终VCF大约需要6-10小时取决于捕获效率和是否并行。trio同时做差不多要1-2天含人工查看IGV、筛选解读时间。肿瘤配对比家系快一点主要是变异检测以后的解读不用跑共分离逻辑但要花时间看CNV、VAF聚类和用药注释。报告编写和复核通常要预留2-3天不亚于分析本身。如果把Sanger验证、一对一遗传咨询、样本回溯也排进日程则一个完整家系或肿瘤项目从样本到盖章报告两周算是比较正常的周期。6. 写在最后几个我觉得一定要记住的实操心得第一做家系和肿瘤数据分析最大的敌人不是复杂的算法而是流程里的默认值。默认参数往往可以跑通但解读时你要清楚每一项设置的来源和影响。人群频率阈值设0.001背后是罕见病患病率假设肿瘤VAF阈值设0.05背后是测序灵敏度和噪声水平的权衡——改任何一个参数前都想明白为什么。第二数据库版本、参考基因组版本、软件版本这“三版本”是回报告时必须写清楚的信息。转录后验证时版本对不上是最低级也最麻烦的错误。第三样本名字的长度和格式在进入分析前就规范化样本名不能有空格、不能有中文路径、不能有特殊符号SampleID和文件夹一一对应。这个建议看起来太基础了但几乎每个项目都有人踩这个坑包括我自己。第四我会习惯在整个流程跑完之后回头再看FastQC和MultiQC报告一次并手动清一遍BAM的中间文件再交付。有一次在快交付时发现某个样本的插入片段分布明显异常追查后发现是那名患者的样本它经历了一次多轮PCR扩增循环过多。如果当时没有回头再做一次QC这个信息就会漏掉。最后说说这个方向后续还能怎么扩展。外显子组并不是终点很多遗传病案例最终需要转录组测序来验证剪接异常肿瘤耐药监测则需要低深度全基因组测序或ctDNA测序来做动态追踪。但不管是哪个方向从家系和肿瘤WES打下的数据分析基础——质控、比对、变异检测、注释、解读、沟通——这套方法论的框架是相通的。把这个底座打牢以后再上新平台、新组合学技术适应的速度会快很多。
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。