1. 别急着数平台和工具先看空间风暴是怎么卷起来的过去半年我一直在做一件事把空间转录组这个方向从2016年第一篇方法学论文到现在的平台、分析工具、公开数据库扎扎实实过了一遍最后整理出来的数字是77种平台、594个分析工具。说实话这个数字让我自己都有点意外——不是因为它多到吓人而是因为这个领域的竞争早就不是谁能做出第一个空间图谱而是你面对这么多选项怎么做出一个不后悔的选择。这篇文章适合三类人看准备上空间转录组平台的PI和实验室管理员、正在被数据分析流程折磨的生信研究生、以及想判断这个方向值不值得投入的临床和科研转化团队。我不会把77种平台和594个工具逐个罗列成流水账那既没意义也不可读。我更想做的事是把平台和技术路线梳理成一张决策地图把工具有效地分成真正值得用和纯粹用来凑综述篇幅两类再把我自己实测跑通Visium、Stereo-seq等数据的经验踩坑写下来。如果你刚入坑我最想先帮你建立的一个判断是空间转录组不是一个技术而是一整条技术谱系不同谱系之间的原理差异比你想象的大得多。1.1 一句话讲明白空间转录组到底在测什么要理解空间转录组最好的类比是把组织样本当成一盘菜。传统bulk RNA-seq的做法是把一整盘菜直接丢进破壁机打成浆然后测浆液里有哪些成分。你确实得到了这盘菜里有番茄、有洋葱、有肉但番茄的汁水到底流向了哪里哪片肉旁边挨着哪片洋葱全部丢失了。单细胞RNA-seq稍微好一点相当于把菜里的每个食材粒都单独捞出来标好身份但捞的过程中盘子被搅散了你还是不知道原来在盘子里肿瘤细胞旁边坐着谁、T细胞是一圈一圈围在外围还是渗透进了肿瘤内部。空间转录组做的事是在不破坏盘子的前提下逐点标记每个位置的菜名。它把基因表达信息放回了组织的物理坐标里所以你能拿到两类信息一是每个空间点位上有什么基因在表达what二是这些表达点之间的空间关系where。后面这类信息才是传统转录组拿不到的核心增量。从方法学时间线看2016年Spatial Transcriptomics论文发表2017年前后出现Slide-seq、HDST等基于空间条形码的方法2020年10x Visium商业化把门槛大幅拉低2021年国产的Stereo-seq进场2022到2023年Xenium、MERSCOPE、CosMx这些亚细胞分辨率的成像平台集中落地。五年时间从实验室黑科技变成了三甲医院和科研平台都能排上号的常规服务。1.2 为什么肿瘤微环境和脑科学最先吃到了红利领域爆发不是凭空来的是因为它砸中了两批最急需空间信息的用户。第一批是肿瘤研究者。以前我们只知道肿瘤组织里有CD8T细胞、有调节性T细胞、有癌症相关成纤维细胞但不知道它们是怎么空间排布的。现在可以在组织原位看到浸润型肿瘤边缘到底有没有T细胞T细胞是被物理隔离在基质胶原外面还是已经渗透到肿瘤巢内部三级淋巴结构的密度和位置和免疫治疗应答有什么关系这些不是靠单细胞能回答的问题必须靠空间信息。配受体分析也只是在空间转录组出现之后才从细胞群之间的猜测变成了相邻细胞之间的实证。第二批是神经科学。大脑本身就是靠精细解剖结构组织的皮层分层、海马分区、纹状体斑块每个区域功能不同基因表达谱也不同。以前我们只能取脑子里的一个区域磨碎测序把区域平均当真相。现在直接用DLPFC背外侧前额叶这类已经做过精细注释的组织做空间转录组可以让算法在无监督情况下自动恢复出6层皮层结构。这种注释已知、技术可验证的特性让大脑组织成了每种新平台、每个新工具上线时的天然benchmark。1.3 平台数量爆炸的真正原因77种平台不是天上掉下来的。我梳理后发现几乎所有方法都可以归到三条底层思路的排列组合里把RNA捕获到带空间条形码的载体上再测序、直接用显微镜在组织原位逐步解码RNA、以及物理切下一小块组织再做常规测序。每种思路下都有十几种基于不同工程细节的变体。比如捕获式平台中条形码可以印在规则排列的斑点Visium、随机排列的微珠Slide-seq、半导体光刻的网格HDST、DNA纳米球阵列Stereo-seq上甚至2023年的Slide-tags直接把单个细胞当成捕获单元让单细胞RNA-seq的建库逻辑服务于空间定位。成像式平台也分裂成两类以MERFISH和seqFISH为代表的多轮FISH成像以及以STARmap和ExSeq为代表的原位测序。我做那个77的平台筛选时给自己定了个标准必须是能在独立实验室复现、或者已经商业化交付的。很多发在预印本上、代码不公开、数据只跑了几个切片就再也没下文的方法我不会把它们算进有效清单。这个标准筛掉了一批一次性论文平台留下来的基本就是我们现在能在实验设计阶段真正考虑的对象。2. 77种平台背后的三条技术路线以及选型时的真实权衡你不需要记住77个平台的名字但必须理解三条技术路线的底层逻辑。因为几乎所有选型困惑最后都归结为你的问题更适合哪条路线。2.1 三条技术路线捕获测序、成像、显微切割第一条路线是捕获测序sequencing-based。原理相当于在一片玻璃上铺满密密麻麻的带地址的小纸条RNA从组织扩散出来后被小纸条上的探针抓走反转录成cDNA然后整张片子的cDNA一起回收建库测序。测完的每一条read上都带着小纸条上的地址条码反查回去就知道它来自组织的哪个位置。代表平台有Visium、Slide-seqV2、HDST、Stereo-seq、DBiT-seq以及2023年出现的Slide-tags。第二条路线是成像imaging-based。原理是不把RNA拿出来测序而是直接在组织切片上做荧光标记通过多轮杂交或原位测序让每个RNA分子在显微镜下闪现出可识别的条形码。由于是光学成像理论上分辨率可以做到单分子级别代表平台有MERFISH、seqFISH、STARmap以及商业化后的MERSCOPE、Xenium、CosMx。第三条路线是显微切割dissection-based。做法比较朴素用激光把感兴趣的细胞团或区域切下来或者用数字空间轮廓系统如GeoMx DSP在选定区域释放探针收集信号然后对每一份切下来的样本单独测序或计数。代表性技术包括LCM-seq、Geo-seq、Tomo-seq。这条路线分辨率最粗但对高度降解的FFPE临床样本最友好而且没有基因panel上限的困扰。三条路线的核心取舍就一句话捕获测序追求全转录组高通量但分辨率受限于spot或bead的尺寸成像追求亚细胞分辨率单细胞边界但基因数往往要预先设计显微切割追求临床样本兼容灵活区域选择但空间连续性和通量都弱。2.2 核心参数对照分辨率、视野、基因数的三角博弈平台选型最核心的三个参数是分辨率、视野大小、可检测基因数。这三个参数是互相制约的不存在一个平台同时做到极致。平台技术路线分辨率基因覆盖代表性视野组织兼容10x Visium捕获测序55 µm斑点约含1-10个细胞全转录组6.5×6.5 mm新鲜冰冻、FFPE探针版10x Visium HD捕获测序2 µm小方格全转录组探针版6.5×6.5 mm新鲜冰冻、FFPESlide-seqV2捕获测序~10 µm微珠全转录组受组织大小限制一般较小新鲜冰冻Stereo-seq捕获测序纳米球间距约500 nmbin后可到1-2 µm全转录组1×1 cm至2×2 cm可定制新鲜冰冻为主MERSCOPEMERFISH成像亚细胞定制panel常规数百基因约1 cm²新鲜冰冻为主Xenium成像原位测序亚细胞数百至数千基因有5k panel约12×24 mm的视野可拼接FFPE、新鲜冰冻CosMx SMI成像原位测序亚细胞最多约6000基因可加蛋白约100 mm²FFPE为主seqFISH成像亚细胞约万级基因视野较小新鲜冰冻实验门槛极高分辨率高不一定等于单细胞分辨率。Visium的55 µm斑点里通常混了几到十几个细胞它给出的本质上是小区块的平均表达谱Slide-seqV2和Stereo-seq虽然捕获单元小但分析时要根据细胞密度决定是否bin到细胞尺度真正能画出细胞边界的是成像类平台因为它们同时采到了细胞核染色和形态信息可以做细胞分割。2.3 选型时最容易犯的三个错误我见过最多、也最值得写的三个错误判断第一个错误是拿成像平台做发现型实验。成像平台要提前设计基因panel比如500基因、数千基因。如果你是想在未知组织里找新marker、新细胞状态那一个固定panel天然会漏掉你没有预判到的基因。这时候全转录组捕获平台才是对的哪怕分辨率没那么好看。反过来如果你已经有一批明确的候选基因只是想看它们在组织里精确出现在哪些细胞那盲选全转录组平台就是浪费成像平台不仅便宜还能直接给你单细胞级别的答案。第二个错误是以为高分辨率一定更好。Stereo-seq和Visium HD的原始数据量非常大一张1×1 cm的片子动辄千万级spot单是存h5ad文件、调PCA、算邻居图就可能吃掉几百GB内存。你的计算资源和分析时间也是实验成本的一部分。不少场景下一个55 µm的Visium spot配合好的反卷积工具已经能回答哪个区域的细胞类型比例发生了变化没必要硬上亚细胞分辨率。第三个错误是忽略FFPE和新鲜冰冻的兼容性。临床来源的FFPE样本RNA降解严重基于poly-A捕获的方式基本不能用必须选探针杂交路线比如Visium FFPE、Xenium、CosMx或者成像平台的RNA探针。做临床队列立项前先确认平台官方支持你的样本类型这个优先级比分辨率高得多。2.4 预算有限时怎么选如果预算有限我的建议按优先级排序先用公共数据把分析流程跑通下文会讲怎么找再考虑做自己的样本。自己的样本若以全转录组为目标Slide-seqV2、Visium是性价比高的入门档若样本是FFPE且基因谱明确CosMx或Xenium的panel反而可能比全转录组方案便宜且信息密度更高。预算决策还有个隐蔽成本数据分析和人员时间。我自己见过不止一个组为了省单张芯片的钱选了冷门平台结果分析工具链不稳定、社区没人可问、一个质控问题卡了三周。商业成熟度高的平台配套文档、Github issue、第三方教程和云分析平台都更完善这些便利是值得算进实际成本里的。3. 594个工具不等于594个选择真正值得放进工作台的清单平台是尽头的事工具是另外一片海。594这个数字如果摊在一张表里看就是壮观但如果把它当成每个都该试用一下就完了。我是用分析流水线分层的方法来做工具筛选的每层只需要认准一到三个主力工具。3.1 先按流水线把工具分成七层我习惯把空间转录组计算分析拆成七层第一层数据读取与预处理从SpaceRanger/SAW等平台官方流程的产物读入做基础QC。第二层归一化、去噪、插补library size校正、高变基因、空间背景校正。第三层空间结构域识别与聚类把spot按区域分组成有生物学意义的domain。第四层差异表达与空间可变基因检测找哪些基因的表达随空间变化。第五层细胞类型反卷积与单细胞映射把混合spot解成细胞类型比例。第六层细胞互作、生态位、轨迹ligand-receptor、邻域富集、空间轨迹。第七层可视化、数据库、可交互平台。任何一篇空间转录组分析论文基本都能映射到这七层里。分层之后你会发现594个工具的实际分布极不均匀聚类和结构域识别那层工具数量爆炸因为每篇方法学论文都想在这层重新发明一个聚类算法反而是最基础的预处理层靠谱工具少得可怜几乎只有各平台的官方流程加少数几个生态框架。3.2 预处理与质控层最不性感但最决定成败我经常对合作者说空间转录组分析里90%的坑都在前两步数据读入和坐标理解。如果你用的10x VisiumSpaceRanger的产物结构要非常熟悉outs/ ├── filtered_feature_bc_matrix.h5 ├── filtered_feature_bc_matrix/ └── spatial/ ├── tissue_positions_list.csv ├── scalefactors_json.json ├── tissue_hires_image.png └── tissue_lowres_image.pngtissue_positions_list.csv是整个分析最容易被误用的文件它给的坐标是像素坐标不是物理微米坐标scalefactors_json.json里存的是图像缩放因子做配准和可视化时不能跳过。Scanpy生态里sc.read_visium()能把这些信息拼起来但之后用Squidpy或Giotto做空间邻居图时要确认coord_type参数到底是generic、grid还是visium选错会让邻居关系完全乱套。预处理层的第二个关键判断是切不切的背景spot。Visium捕获区的spot很多落在组织之外SpaceRanger在tissue_positions_list.csv里用in_tissue字段标了读数据后要按这个过滤。很多新手不做这一步最后聚类出来的细胞群其实是玻片上的背景信号。3.3 空间结构域识别BayesSpace、SpaGCN、STAGATE与GraphST怎么选空间结构域识别的目标是把spot按表达相似性加空间连续性分成有意义的区域。这一层的工具最多但我实测下来真正值得放进工作台的就四类BayesSpace、SpaGCN、STAGATE、GraphST。BayesSpace是老牌方法核心思路是在聚类时引入空间先验——相邻spot更倾向于属于同一类。它自带两个吸引人的功能一是可以用马尔可夫随机场借用邻居信息增强分辨率把每个55 µm的Visium spot推测成更细的subspot二是参数直观、R生态集成好对下一步做差异分析很友好。缺点是在强梯度组织比如肿瘤浸润边界上容易过度平滑且对PCA的输入维度比较敏感。SpaGCN把组织学图像也引入聚类表达相似、空间相近、HE染色相似的spot归到一起。它的设计在肝脏、肿瘤这类有明确病理分区上有天然优势但依赖组织学图像特征提取如果你的切片染色质量一般这部分信息反而是噪声。STAGATE用图注意力自编码器学习spot的嵌入表示对多样本迁移和跨平台泛化做得不错发表后社区反馈和Github活跃度都比较高。GraphST则引入了对比学习在处理批次效应和跨切片对齐时有一定优势。我的选型建议很简单先用BayesSpace或STAGATE跑一遍作为主结果再用另一个做交叉验证。如果两个独立算法得到的domain结构一致这个结论比单个算法的输出可靠得多。不要在这层同时跑五个工具然后挑最漂亮的那个结果写文章那属于自欺欺人。3.4 反卷积与空间通信RCTD、cell2location、CellChat的正确打开方式Visium这类捕获平台本质上测的是混合spot需要反卷积把每个spot里的细胞类型比例解出来。这是我从大量分析中确认最有价值也最容易被误用的一层。RCTD是速度和稳定性的最佳平衡输入对应的scRNA-seq参考数据用细胞类型比例平台效应校正的思路做鲁棒分解几分钟到几十分钟就能跑完一张Visium切片。SPOTlight基于NMF操作直观但准确性在老参考数据上一般。cell2location是贝叶斯模型能做更精细的细胞类型定位和空间共定位推断但运行时间和内存开销大动辄以小时计。Tangram则是深度学习方法不仅能估比例还能把单细胞转录组映射到空间上适合做跨模态整合。空间通信是更进一步的问题知道了spot位置和细胞类型后推断某两种细胞之间是否存在配受体介导的通信。CellChat是单细胞通信分析里用得最多的它有原生的空间模式支持会根据spot间距离和配受体数据库做推断并输出置换检验的P值。COMMOT把最优传输理论引入通信分析在时空动态和方向性推断上比传统打分法细腻。MISTy的思路不太一样它把每个spot的信息拆成几个view自身表达、邻居spot、邻近区域用多元模型估测不同空间尺度的调控贡献做生态位和微环境建模时很实用。反卷积最容易翻车的点有两个。一个是参考scRNA-seq数据不匹配参考数据和空间数据来自不同病人、不同组织状态、不同物种细胞类型定义都对不齐结果就是每个spot都被解成相似的混合比例看起来漂亮但没有任何意义。另一个是把解出来的比例当真实测量直接做统计忽略比例估计本身有不确定性。我每次跑完反卷积一定会做两个验证看看已知marker基因的空间表达是否和解出的细胞类型空间分布吻合再抽几个spot看它们的原始表达谱能不能支撑解出的主要细胞类型。3.5 数据库与可视化让公共数据成为你的练手场594个工具池里数据库我单独说。空间转录组领域一个很大的好处是公共数据极其丰富。SODBSpatial Omics DataBase整合了大量Visium、Slide-seq等公开数据集按物种、组织、平台分类还带了一部分预处理好的结果CROST是更偏转录组的综合性资源库STOmicsDB是国内团队做的特别适合Stereo-seq数据的下载和浏览。10x Genomics官方也提供一批公开Visium数据集其中Human DLPFCMaynard et al., 2021是几乎所有聚类算法做benchmark的标准数据。可视化工具里Scanpy/Squidpy自带的空间散点图足够支撑日常出图Vitessce这类交互式平台适合做数据探索和审稿人友好型网页展示。我不建议在可视化层浪费太多精力追新工具先把表达矩阵的空间位置映射这一张图做干净比什么花哨交互都管用。4. 从FASTQ到发表级图我跑通Visium全流程的实操与踩坑下面这套流程是我自己在若干批10x Visium新鲜冰冻数据上跑通的原则是尽量用社区标准方案少用会断维护的工具。它不能覆盖所有平台但绝对能覆盖你从零开始的第一套流程。4.1 一条可以照抄的命令行流程拿到Illumina测序FASTQ后第一步是跑SpaceRanger完成读数、比对、生成空间矩阵的全过程spaceranger count --idSample1 \ --transcriptomerefdata-gex-GRCh38-2020-A \ --fastqs/data/fastq_dir \ --sampleSample1 \ --image/data/tissue_image.tif \ --slideV10J01-123 \ --areaA1 \ --localcores16 \ --localmem64这里最容易被低估的是--image和--slide/--area的组合。SpaceRanger会把切片上明场图像和捕获区对齐如果明场图拍得歪了、或者slide编号写错后面要么自动对齐失败要么生成的组织mask完全错位。遇到这种情况别硬调参直接加--manual-alignment手动选几个landmark比反复跑全流程省时间。拿到outs目录后进入Python生态import scanpy as sc import squidpy as sq adata sc.read_visium(Sample1/outs/, library_idSample1) adata.var_names_make_unique() # 基础QC过滤低表达的基因和明显背景spot sc.pp.filter_genes(adata, min_counts5) adata adata[adata.obs[in_tissue].astype(bool)].copy() # 归一化 sc.pp.normalize_total(adata, target_sum1e4) sc.pp.log1p(adata) # 高变基因和PCA sc.pp.highly_variable_genes(adata, flavorseurat, n_top_genes2000) sc.pp.pca(adata, n_comps50) # 构建空间邻居图关键步骤用空间坐标而不是UMAP坐标 sq.gr.spatial_neighbors(adata, coord_typegeneric, n_neighs8) # 聚类 sc.tl.umap(adata) sc.tl.leiden(adata, resolution0.7) # 出图 sq.pl.spatial_scatter(adata, colorleiden)sq.gr.spatial_neighbors是关键它告诉算法哪些spot在组织上是挨着的。如果忘了这一步后面所谓的空间聚类就是普通单细胞聚类毫无空间意义。之后如果想做更精细的结构域识别可以把过滤、归一化后的对象转成SingleCellExperiment喂给BayesSpace的R代码或者直接用STAGATE的Python接口继续。4.2 三个让我半夜爬起来看日志的坑第一个坑是坐标单位混用。Visium的tissue_positions_list.csv给的是像素坐标Slide-seq给的往往是微米坐标Stereo-seq的bin坐标又是另一种设计。如果你把一个Visium对象和一批Slide-seq数据合并可视化不做单位转换出来的空间图要么完全重叠要么一个缩在角落里。我的习惯是建表时统一保留三列pixel_row、pixel_col、物理坐标如果平台提供并用平台原生的读取函数保证坐标语义不丢。第二个坑是条带伪影被当成生物学梯度。Visium芯片上spot的捕获效率和批次边缘效应会形成沿芯片方向分布的条带状背景这在聚类时会表现为一个看起来很有规律的domain。怎么排查先看Morans I这类空间自相关统计再看条带方向是否和生物学结构比如皮层分层吻合最后把不同批次的同组织样本放在一起跑Harmony整合如果domain在整合后消失基本就是技术伪影。第三个坑是内存爆炸。Stereo-seq或Visium HD一张切片能产生几千万个spoth5ad对象直接怼内存会死得很惨。处理大数据的标准做法有两个一是用AnnData的backed模式把表达矩阵留在磁盘按需读取二是分析前先做grid binning把多个相邻像素合并成一个分析单元等结构域识别完成后再映射回原始分辨率。我一般拿到大视野数据后先用1 µm或2 µm bin把全转录组层面的空间结构定了再决定是否要在亚细胞尺度深挖单个区域而不是一上来就全分辨率硬跑。4.3 如何确认你的结论不是流水线跑出来的幻觉这是我认为最有价值的一节。很多分析跑完p值都显著图也都好看但结论可能是分析流程的伪产物。我做每个空间转录组项目最后固定要做四个层面的验证。第一层是聚类稳健性验证同一份数据改一下聚类分辨率或邻居数看看关键domain还在不在。如果稍微改参数结论就翻盘说明这个结构很脆弱。第二层是空间信号验证对每个目标domain检查它的marker基因是否真的在空间上富集在这个domain位置。用Squidpy的spatial_autocorr算Morans I比单纯看rank_genes_groups的P值更可靠后者完全没考虑空间自相关。第三层是独立生物学验证如果平台数据做出来的是肿瘤浸润边缘T细胞减少就该拿同一块组织的免疫组化切片实际验证。空间转录组算出来的任何结论最好都能在某一种独立模态HE染色、IHC、ISH上看到对应影像。第四层是多工具交叉验证关键结论尽量用两种不同原理的工具跑交叉。比如反卷积用RCTD和cell2location各跑一版看细胞类型空间分布是否一致结构域用BayesSpace和STAGATE各跑一版看区域注释是否吻合。交叉一致的结果才值得写进文章只有单个工具出的结论我会默认存疑。5. 未来两年多组学共检测与多样本统计会是新的分水岭最后一个板块我想说说我在整理这594个工具时观察到的趋势以及刚入坑的人该怎么规划自己的学习和实验路径。5.1 从mRNA到多组学共检测空间转录组正在从只测RNA走向RNA加蛋白加更多模态的共检测。商业平台上CosMx已经支持转录本和蛋白panel同时检测Xenium也在往蛋白扩展这方向走方法学上把CITE-seq这类蛋白标签思路搬到空间平台上的工作越来越常见。将来一个空间点位既能看到基因表达又能看到细胞表面蛋白还能通过MALDI成像拿到代谢物分布这种多模态信息对理解亚细胞结构和微环境生态位会带来质的改变。多组学落地带来的分析挑战会比想象中来得快不同模态的分辨率、灵敏度、数据分布都不一样怎么把它们放到同一个空间坐标框架里比较怎么处理模态间的批次不一致不是加一个插件就能解决的。MISTy这类天然支持多种view输入的模型以及MOFA这类多因子分析框架都是我先押注的方向。5.2 空间统计与多样本设计伪重复是最大的隐形杀手比平台再新一点、更值得警惕的是多样本统计中的伪重复问题。现在很多空间转录组研究是这样的做两个病例组织一个对照组一个处理组跑出几千个spot然后直接把几千个spot当独立样本t检验得到满天星式的显著P值。这个做法在统计学上是完全站不住的——同一个组织切片上的spot之间有强烈的空间相关性和个体异质性它们根本不是独立重复。正确的思路是至少做到样本级伪bulk把每个样本按domain聚合出区域表达式变化用边缘等传统bulk差异分析方法处理把样本作为生物学重复。更前沿的做法是用空间可变基因检测比如SPARK-X、nnSVG配合混合效应模型但这类工具还在快速演进阶段暂时不建议非统计背景的人直接上。一个大原则是你宣称的生物学重复数量不是spot数是样本数。这一点如果不改未来审稿会越来越难通过。5.3 给刚入坑的人一张抄作业路线图如果你今天才开始接触空间转录组我的建议是不要一上来就谈平台、看仪器、下订单。先花一周时间在公共数据上把完整分析流程跑通找一个10x Visium的公开HE切片和表达矩阵用上面给出的Scanpy加Squidpy流程从头做到聚类出图。再花一周做一次BayesSpace或STAGATE的结构域识别然后用RCTD做一次反卷积。整个流程跑完你对空间数据的格式、坐标、质控坑就会有非常具体的体感。之后再去选平台你的判断标准会完全不一样。这时候你就知道同样一笔经费到底是买更高分辨率还是买更多样本数你也知道商业平台配套的分析云服务虽然是付费的但省下的时间足够把数据多跑好几遍。工具上优先选择维护活跃、文档完整、社区用户多的生态成员——Scanpy/AnnData生态、Squidpy、Giotto以及每个层级的那一到两个首选工具已经能覆盖95%的常规分析需求。594个工具里的绝大多数更适合在方法学对比论文里出现而不是躺在你的生产流程里。最后说句个人体会。我整理完这份清单后最大的改变是开始给自己维护一份分析工具台帐每个工具的版本号、输入输出格式、跑过的数据集、最后验证日期都记在一份文本里。空间转录组工具迭代极快三个月不更新就可能发现原来的脚本跑不通了。有一个台账在至少下次复现结果时不用再从几百个issue和commit里考古。