尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

生物学重复与技术重复:实验设计与统计分析中的关键区别

发布时间:2026/9/25 1:14:20

资讯中心
01
ARTICLE

生物学重复与技术重复:实验设计与统计分析中的关键区别

生物学重复与技术重复:实验设计与统计分析中的关键区别
1. 为什么这两个词总让人在组会上被问住如果你做过一段时间的湿实验大概率经历过这样的场景组会上你汇报完一组数据导师或者PI突然问一句——“你这个n是多少是生物学重复还是技术重复”你心里咯噔一下嘴上说“三个重复”但你自己也不太确定那三个孔到底算哪种重复。更尴尬的是隔壁做生信的同学也来凑热闹说他的样本量是“三次技术重复取平均”结果被统计背景的师兄当场指出你那个根本不能叫独立样本。这不是谁笨的问题。生物学重复biological replicate和技术重复technical replicate这两个概念几乎每个做实验的人都“听过”但真正能说清楚、并且在实验设计和数据分析中正确使用的人比例并不高。它们直接决定了你的统计检验能不能做、用哪种检验、自由度怎么算、结论能不能外推。用错了轻则被审稿人质疑重则整个结论站不住脚。这篇内容我想把这两个概念彻底讲透。不是教科书式的定义罗列而是从“你为什么要关心它”出发把定义、判断标准、实验设计中的取舍、统计上的处理方式、以及我自己踩过的坑一层层拆开。适合刚进实验室的本科生、正在写毕业论文的研究生也适合需要和湿实验同事协作的生信分析人员。读完你至少能做到两件事第一别人问你n是几的时候你能准确回答第二你能判断一篇论文里的重复设置是否合理。先给一个最粗的区分后面再展开技术重复测的是同一个样本生物学重复测的是不同的样本。就这么简单一句话但魔鬼全在细节里。2. 把定义掰开揉碎同一管样本和同一个处理下的不同个体2.1 技术重复同一份样本反复测量技术重复的核心特征是样本来源完全相同。你从一只小鼠身上取了一块肝组织匀浆之后分成三管分别上机测三次这三个数据就是技术重复。或者你做qPCR同一个cDNA模板加了三个孔这三个孔的Ct值也是技术重复。技术重复要回答的问题是我的测量手段本身有多稳定它衡量的是仪器误差、操作误差、试剂批次内的波动。比如你同一管样本测三次得到三个数值它们之间的差异不包含任何生物学变异纯粹是“测量噪声”。这里有个很容易混淆的点技术重复不一定非得是“同一时间同一批次”。你今天测一次明天把同一管样本从冰箱里拿出来再测一次这也算技术重复只不过它额外引入了“天与天之间”的批次效应。严格来说这种叫跨批次技术重复它衡量的是测量系统在时间维度上的稳定性比同批次技术重复更严格。技术重复的典型场景包括qPCR的复孔通常做2到3个技术复孔Western blot同一样本跑多块胶测序时同一个文库上机多个lane酶标仪同一孔多次读数细胞计数时同一悬液多次取样计数2.2 生物学重复不同个体同一处理生物学重复的核心特征是样本来自不同的生物学个体或独立的实验单元。你有三只小鼠都做了同样的药物处理从每只小鼠取一块肝组织分别测这三个数据就是生物学重复。生物学重复要回答的问题是这个处理效应在群体层面是否稳健它包含了测量噪声但更重要的是包含了个体间的生物学变异。而个体间变异恰恰是你想把结论外推到“整个群体”时必须考虑的。这里“个体”的定义要根据你的实验体系来定。做小鼠实验一只小鼠就是一个个体。做细胞实验情况就复杂了——同一个细胞株传代后分到三个皿里这三个皿算不算生物学重复这个问题在学术界一直有争议我后面会专门讲。做田间实验一个小区是一个实验单元。做临床研究一个病人是一个个体。生物学重复的典型场景包括三只不同的小鼠接受相同处理三个不同供体的血液样本三株独立来源的细胞系三块不同田块的同一种处理三位患者的肿瘤组织2.3 一张表把两者的边界钉死维度技术重复生物学重复样本来源同一个体、同一管样本不同个体、独立实验单元衡量的是什么测量误差、仪器稳定性处理效应的稳健性、个体间变异能否用于统计推断不能作为独立样本可以作为独立样本典型数量2到3次至少3个通常更多增加它能改善什么降低测量噪声提高均值精度提高结论的外推能力增加它的成本低同一份样本多用一点高需要更多个体、更多时间这张表建议你存下来。每次设计实验或者审稿的时候对照看一眼能避免大部分低级错误。3. 细胞实验里的灰色地带三个皿到底算不算三个重复3.1 争议的根源传代次数和独立来源细胞实验是这两个概念最容易翻车的地方。假设你养了一瓶HeLa细胞胰酶消化后分成三个皿分别加药处理最后收蛋白做Western blot。这三个皿的数据算生物学重复吗严格派会说不算。因为这三个皿来自同一瓶细胞遗传背景完全相同它们之间的差异主要是操作误差和微环境波动不包含真正的个体间遗传变异。你把这三个皿的数据当作n3做t检验审稿人可能会质疑你“伪重复”pseudoreplication。宽松派会说如果这三个皿是独立传代、独立处理的可以近似看作生物学重复。尤其是在细胞株实验里很难做到真正的“不同个体”所以领域内有一定容忍度。我的看法是取决于你的结论想推到哪里。如果你只是想说“这个药在这个细胞株里有作用”三个皿的数据加上技术重复基本够用。但如果你想把这个结论推广到“这个药对这类细胞普遍有效”那你就需要多个独立来源的细胞株或者至少是不同代次的细胞。3.2 一个可操作的判断标准我自己的判断标准是这样的你可以参考同一瓶细胞同一天分皿同一天处理技术重复不能当独立样本同一瓶细胞不同天分皿不同天处理准生物学重复可以报告但要在方法里写清楚不同来源的细胞株比如从不同实验室引进的同一株或者不同代次且间隔较大生物学重复不同细胞株比如A549和H1299独立的生物学重复但要注意遗传背景差异提示如果你在写论文方法部分一定要明确写“n3 biological replicates”还是“n3 technical replicates”。很多审稿人第一眼就看这个。写“n3”而不说明是什么重复是常见的被拒理由之一。3.3 细胞实验的实操建议如果你现在正在设计细胞实验我的建议是至少做三次独立的生物学重复这里的“独立”指的是不同天、不同批次的细胞最好是从不同代次的冻存管复苏。每次生物学重复内部做技术复孔比如qPCR做3个技术复孔取均值作为一个生物学重复的值。不要用技术重复冒充生物学重复。三个孔的数据直接拿来算标准差那个标准差会小得离谱统计显著性会虚高。在图上标注清楚。图注里写“Data are shown as mean ± SD of three independent biological replicates”而不是含糊的“n3”。我见过太多论文因为这个问题被要求补实验。补实验的成本远高于一开始就设计对。4. 实验设计阶段就要想清楚的事n到底怎么定4.1 先问自己我要推断什么实验设计的起点不是“我要做几个重复”而是“我的结论要推到哪里”。这个逻辑顺序不能反。如果你的结论只针对你测的那几个样本那不需要统计学也不需要重复。但生物学实验几乎从来不是这样。你要么想把结论推到“这个处理对这类细胞有效”要么推到“这个基因在這種组织里普遍高表达”。只要有“推”的动作就需要生物学重复来估计群体层面的变异。技术重复解决不了这个问题。你技术重复做得再多也只是把同一个点的测量值估计得更准但你对“其他个体是什么情况”一无所知。4.2 样本量的估算不是拍脑袋很多人定n3是因为“大家都做3个”。这个理由在组会上说不出口但在实际中很常见。n3不是不行但它是一个经验值不是万能值。真正决定n的是三个因素效应量effect size你预期的处理组和对照组差异有多大变异程度variability个体间差异有多大统计功效power你希望以多大概率检测到真实存在的效应这三个因素和n的关系可以用功效分析来估算。R里有pwr包G*Power是常用的图形界面工具。我一般会在预实验之后做一次功效分析看看n3够不够。如果个体间变异很大n3很可能检测不到真实效应这时候要么增加n要么改进实验降低变异。4.3 技术重复做几个合适技术重复的数量相对灵活。qPCR通常做2到3个技术复孔取均值。测序的话同一个文库的技术重复通常不是必须的因为测序深度本身可以提供一定的内部重复性。技术重复太多是浪费。你做5个技术复孔均值确实更准了但你的生物学重复如果只有2个整体结论依然不可靠。资源应该优先分配给生物学重复。一个常见的资源分配原则是先把生物学重复做到至少3个再考虑技术重复。如果资源有限宁可3个生物学重复各做1次技术测量也不要1个生物学重复做3次技术测量。5. 统计分析的雷区把技术重复当生物学重复会怎样5.1 自由度虚高与假阳性这是最核心的统计问题。假设你有一个处理组和一个对照组每组实际上只有1个生物学样本但你每个样本做了3个技术重复。如果你把这6个数据点当作6个独立样本做t检验自由度是4。但实际上你的独立样本只有2个真正的自由度接近0。自由度虚高的直接后果是p值被严重低估假阳性率飙升。你可能会得到一个p0.001的“显著”结果但实际上这个差异可能只是测量噪声。我用一个模拟例子来说明。假设处理组和对照组的真实生物学均值完全相同个体间变异为0只有测量误差。你取1个个体做3次技术重复和取3个个体各做1次测量前者更容易得到“显著”结果因为它的数据点看起来更多但实际信息量更少。5.2 正确的统计处理方式正确的做法是技术重复先取均值或中位数把均值作为该生物学重复的值然后用这些值做统计检验。具体流程每个生物学重复内部技术重复取均值得到每个生物学重复的一个汇总值用这些汇总值做组间比较t检验、ANOVA等报告时说明n是生物学重复的数量如果你用的是混合效应模型mixed-effects model可以把技术重复作为随机效应嵌套在生物学重复内部。这种做法更精细但不是所有场景都需要。对于大多数常规实验先取均值再检验就够了。5.3 常见统计方法的选择实验设计推荐统计方法注意事项两组各3个生物学重复独立样本t检验先检查方差齐性三组及以上单因素ANOVA 事后检验多重比较校正同一批样本处理前后配对t检验配对关系要明确多因素设计双因素或多因素ANOVA注意交互效应技术重复嵌套在生物学重复内混合效应模型需要统计软件支持注意如果你只有2个生物学重复很多统计检验的功效都很低。n2可以做描述性分析但做推断性统计要非常谨慎。审稿人看到n2通常会要求补实验。6. 那些年我踩过的坑和见过的翻车现场6.1 把同一管样本分三管测序当作三个重复这是我见过最多的错误。有人提取了一次RNA建了一个文库然后上机测了三个lane把三个lane的数据当作三个生物学重复做差异表达分析。结果差异基因一大堆但后来发现这些“重复”之间的相关性高达0.99根本没有生物学变异的信息。测序的技术重复和生物学重复在数据分析上的处理完全不同。技术重复可以用来评估测序质量但不能用来做组间差异的统计推断。如果你只有一个生物学样本那这个实验本质上是一个n1的案例研究不能做群体层面的推断。6.2 细胞实验的“三次独立实验”其实不独立有人写“three independent experiments”但实际上三次实验用的是同一批冻存的细胞同一天复苏只是分了三次收样。这种“独立”是打了折扣的。审稿人如果较真会要求你说明三次实验的细胞来源和传代情况。我的做法是每次生物学重复用不同代次的细胞最好是从不同冻存管复苏处理时间也尽量错开。这样即使有批次效应也能在统计上被部分吸收。6.3 图注里含糊其辞“Data are presented as mean ± SD, n3.” 这句话本身没问题但如果不说明n是什么读者和审稿人就会猜。猜错了就是你的问题。正确的写法是“n3 biological replicates”“n3 independent experiments”“n3 mice per group”“n3 technical replicates, data are representative of three independent experiments”最后这种写法适用于Western blot这类半定量实验。图注里写清楚能省掉很多审稿意见。6.4 技术重复的均值不能增加n有人觉得我每个样本做3个技术重复取均值之后这个均值比单次测量更可靠所以可以算作一个“更好的”数据点。这个想法没错但“更好”不等于“更多”。你的n依然是生物学重复的数量不会因为技术重复而增加。如果你在论文里写“n9”但实际上是3个生物学重复各3个技术重复审稿人可能会认为你在误导。正确的写法是“n3 biological replicates, each with 3 technical replicates”。7. 从实验台到分析脚本一个完整的处理流程7.1 数据整理阶段的标记拿到原始数据之后第一件事是给每个数据点打上标记它属于哪个生物学重复哪个技术重复。这个标记在后续分析中至关重要。一个典型的数据表结构sample_idbio_reptech_repgroupvalueS111control2.3S212control2.5S313control2.4S421control3.1...............有了这个结构你就能清楚地知道每个层级的样本量。7.2 汇总与检验的代码示例用R做汇总和检验的一个简单流程library(dplyr) # 假设数据框叫df包含bio_rep, tech_rep, group, value # 第一步技术重复取均值 df_summary - df %% group_by(bio_rep, group) %% summarise(mean_value mean(value, na.rm TRUE), .groups drop) # 第二步用汇总后的数据做t检验 t.test(mean_value ~ group, data df_summary, var.equal FALSE)如果你用Python逻辑是一样的import pandas as pd from scipy import stats # 技术重复取均值 df_summary df.groupby([bio_rep, group])[value].mean().reset_index() # 分组 control df_summary[df_summary[group] control][value] treatment df_summary[df_summary[group] treatment][value] # t检验 t_stat, p_val stats.ttest_ind(control, treatment, equal_varFalse) print(ft{t_stat:.3f}, p{p_val:.4f})7.3 可视化时的注意事项画图的时候我建议柱状图或箱线图上叠加每个生物学重复的数据点而不是技术重复的点误差棒用标准差SD或标准误SEM并在图注里说明是哪种如果技术重复的变异也值得展示可以用不同颜色或形状区分一个常见的错误是图上画了9个点但实际上是3个生物学重复各3个技术重复。读者会误以为n9。正确的做法是只画3个点生物学重复的均值或者用不同标记区分层级。8. 审稿人视角他们到底在盯什么8.1 方法部分的重复描述审稿人看方法部分的时候会特别关注“n”的定义。如果写“n3”但不说明是什么重复大概率会被要求补充说明。如果写“three independent experiments”他们会看你对“independent”的定义是否合理。我审稿的时候会重点看这几个地方细胞实验三次实验是否用了不同代次的细胞动物实验每组几只动物是否同批次测序实验几个生物学样本是否有技术重复统计方法是否把技术重复当成了独立样本8.2 结果部分的统计报告结果部分要报告具体的统计量和p值不能只写“显著升高”。比如“treatment组显著高于control组t4.32, df4, p0.012”。df自由度能反映你的样本量是否合理。如果df大得离谱审稿人可能会怀疑你把技术重复算进去了。8.3 图表中的重复展示图表是审稿人最容易发现问题的地方。如果一张图上有9个点但方法里写n3审稿人就会问这9个点是什么。如果你解释说是技术重复他们可能会要求你重新画图只展示生物学重复的汇总值。我的经验是图上的每个点都应该代表一个独立的实验单元。如果技术重复的变异很重要可以用误差棒或单独的子图展示但不要让读者误以为每个点都是独立样本。9. 一些容易混淆的相邻概念9.1 重复测量与生物学重复重复测量repeated measures是指同一个体在不同时间点被多次测量。这和生物学重复不同。重复测量的数据点之间是相关的需要用配对检验或混合效应模型处理。如果你把重复测量当作独立生物学重复会低估标准误高估显著性。9.2 批次效应与重复批次效应是指不同批次之间存在的系统性差异。如果你在不同天做了三批实验这三批之间可能既有生物学重复的变异也有批次效应。在统计分析时可以把批次作为随机效应纳入模型或者至少检查一下批次之间是否有明显差异。9.3 伪重复的经典定义伪重复pseudoreplication最早是生态学领域提出的概念指的是把非独立的数据点当作独立样本。在分子生物学里把技术重复当生物学重复、把同一只动物的多个组织切片当独立样本都是伪重复的常见形式。识别伪重复的关键是问这些数据点之间是否共享了某个层级的共同来源如果是它们就不是完全独立的。10. 我个人的几条实操原则做了这么多年实验我总结了几条自己一直遵守的原则分享出来供参考。第一条先定生物学重复再定技术重复。生物学重复是统计推断的基础技术重复是锦上添花。资源有限的时候优先保证生物学重复的数量。第二条n3是底线不是目标。如果预实验显示个体间变异很大n3很可能不够。这时候要么增加n要么改进实验方法降低变异。不要硬着头皮做n3然后指望统计显著。第三条方法部分写清楚“independent”的含义。不同天、不同代次、不同个体这些都是“independent”的具体形式。写清楚了审稿人就不会猜。第四条技术重复取均值之后再统计。这是最稳妥的做法。除非你有特殊理由用混合效应模型否则先取均值再检验简单且不容易出错。第五条图注是最后一道防线。图注里把n的定义、误差棒的含义、统计方法都写清楚。很多审稿意见其实是因为信息不完整造成的写清楚了就能避免。最后再分享一个小技巧如果你不确定自己的重复设置是否合理可以找一个统计背景的同事或朋友帮你看一眼实验设计。花十分钟聊一聊可能省掉几个月补实验的时间。这个投入产出比怎么算都划算。
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。