【免费下载链接】feynmanThe open source AI research agent.项目地址https://gitcode.com/gh_mirrors/feynman/feynman点击查看免费下载本技术指南围绕 Feynman 开源 AI 研究代理仓库中的 example_crispr_screen 设计包展开该设计包完整交付了一套以 Brunello 文库为基础、覆盖人蛋白激酶组522 个激酶基因的全基因组 SpCas9 敲除筛选文库——从基因集定义、guide 选择、全基因组脱靶重分析到对照设计、oligo 合成与 Golden-Gate 构建协议、慢病毒转导与测序深度预算。读完本文你将掌握一套可直接复刻的 CRISPR 文库设计方法论并理解 Feynman 如何以「open-science seeds」形式把这类可复现的研究产物沉淀进工作区。设计包概览一份可独立复现的筛选设计交付物example_crispr_screen是一个聚焦**人蛋白激酶组human protein kinome522 个激酶**的 CRISPR-KO 筛选设计包。其设计基底是 Broad GPP 发布的 Brunello 全基因组文库Doench 2016在此基础上完成了激酶子集抽取、全基因组脱靶重分析、对照添加以及完整的构建 测序规划。目录结构如下报告design_report.html —— 自包含报告内嵌全部六张图与所有设计参数基因集与文库表kinome_genes.csv522 个激酶基因及 Manning 分组/家族、UniProt、Entrez、Brunello 覆盖情况与 de-novo 标记、kinase_guides_brunello.csv2,072 条 Brunello 精选 guide4 条/基因含坐标与 Rule Set 2 分数、final_kinome_library.csv完整 3,140-sgRNA 文库含靶向与对照带 QC 结论、oligo_pool_synthesis.csv3,129 条带 BsmBI 适配器的 83-mer 合成寡核苷酸、oligo_order.txt供厂商下单的 id⇥oligo 列表QC 与脱靶guide_ontarget_qc.csv逐 guide 的 GC、poly-T、同聚物、BsmBI、Rule Set 2 标记、offtarget_report.csv逐 guide 的 CFD/MIT 特异性、错配分级计数、编码区脱靶风险、offtarget_coding_hits.csv135 个高 CFD 编码区脱靶位点、denovo_design_worklist.csv37 个基因 53 条 guide 需要自定义设计方案文档construction_protocol.mdoligo 架构、Golden-Gate 克隆、转化与 QC、sequencing_depth_plan.csv代表度 × reads/guide 的场景矩阵图形交付物kinome_groups.png、guides_per_gene.png、ontarget_score_distributions.png、offtarget_specificity.png、library_composition.png、coverage_vs_cells.png。这一整套交付物的设计流程与 plan_design-a-genome-wide-crispr-knockout-scr_d3da0234.json 中记录的 8 个阶段一一对应属于该工作流的真实产物。设计目标与方法学基线根据设计计划 JSON 的任务描述本设计包的目标是定义激酶基因集 → 选择最优 SpCas9 sgRNA → 预测脱靶 → 添加对照 → 规划文库构建与测序深度。方法学基线为环节依据激酶基因定义KinHub / Manning kinome / UniProt PKinase 关键词TK、TKL、STE、CK1、AGC、CAMK、CMGC、atypical及部分脂质/代谢激酶文库基底BrunelloDoench 201676,441 条 sgRNA、19,114 个基因、4 guides/gene 1,000 条非靶向对照脱靶枚举Cas-OFFinder v2.4.1比对 GRCh38Ensembl r110允许 ≤3 个错配特异性评分CFDDoench 2016 MIT/Hsu2013双评分体系注释Ensembl r110 CDS/exon 注释计划 JSON 的可行性评估将该方案标记为high confidence核心方法锚定在已发表的 Brunello 文库每基因 4 条经 Azimuth Rule Set 2 CFD 优化的 sgRNA上唯一的中等风险步骤是全基因组脱靶重分析需下载人类基因组 FASTA 并运行 Cas-OFFinder在 128 CPU 的机器上可处理约 2,000–2,400 条选定 guide。关键数字速览README 中的核心数字构成设计包质量的「硬指标」指标数值靶向激酶基因522518 个在 Brunello 中4 个 de-novo靶向 sgRNA2,0724 条/基因最终文库3,140 条 sgRNA2,072 靶向 1,000 NTC 68 阳性合成池3,129 条 oligo83-merBsmBIMIT 特异性中位数97高风险脱靶 guide128 条6.2%保留并注释克隆代表度≥300×约 939k 菌落筛选代表度≥500×每重复 1.56M 细胞MOI 0.3测序量9 个样本 1,000 reads/guide 约 2,800 万 reads约 3.5% NovaSeq SP 泳道值得注意README 汇总的 NTC 为 1,000 条而 construction_protocol.md 中按最终进入合成池的数量记为 989 条差异源于 8 条含内部 BsmBI 位点的 NTC 在设计阶段被移除、另有若干条改走单独克隆流程两处口径分别对应「设计总数」与「合成池内数量」。基因集与文库分层从 kinome 定义到三级库表激酶基因集kinome_genes.csvkinome_genes.csv 含表头共 523 行即 522 个激酶基因列结构为Symbol, Manning_Name, Group, Family, SubFamily, UniProtID, Entrez, Synonyms, Kinase_Name, found, needs_denovo_design。以 AGC 家族为例可以清晰看到 Manning 分类的粒度Symbol,Manning_Name,Group,Family,SubFamily,UniProtID,Entrez,Synonyms,Kinase_Name,found,needs_denovo_design AKT1,AKT1,AGC,Akt,,P31749,207,PKB RAC,RAC-alpha serine/threonine-protein kinase,True,False GRK1,RHOK,AGC,GRK,GRK,Q15835,6011,RHOK,Rhodopsin kinase,False,True STK38,NDR1,AGC,NDR,,Q15208,11329,NDR1,Serine/threonine-protein kinase 38,False,TruefoundFalse且needs_denovo_designTrue的行如 GRK1、STK38、PRKY即 Brunello 中缺失或覆盖不足、需要自定义设计 guide 的基因。每个基因保留全部四列生物学注释UniProt、Entrez、Synonym、激酶全名为后续交叉引用和结果解读提供了锚点。Brunello 子集kinase_guides_brunello.csvkinase_guides_brunello.csv 收录 2,072 条从 Brunello 中选出的激酶 guide4 条/基因每条附基因组坐标与 Rule Set 2Azimuth分数是后续 QC 与脱靶分析的输入。该步骤的核心工程问题是符号别名映射将 kinome 的 HGNC 符号映射到 Brunello 的靶基因名并统计「基因有 ≥4 条 guide」「基因不足 4 条」「基因完全缺失」三档覆盖情况。最终文库final_kinome_library.csvfinal_kinome_library.csv 是唯一权威的 3,140-sgRNA 文库主表含表头 3,141 行每行含 24 个字段融合了靶向质量、特异性与脱靶判定。以 AKT1 的 4 条 guide 为例sgRNA_id,Kinome_Symbol,guide_type,sgRNA_sequence,PAM,RS2_score,GC_pct,max_homopolymer,MIT_specificity,CFD_specificity,max_ot_cfd,max_cfd_coding_ot,n_ot_coding,ot_0mm,ot_1mm,ot_2mm,ot_3mm,paralog_multicut,ontarget_flag,flag_coding_offtarget,guide_verdict AKT1_1,AKT1,kinase_targeting,CCTGCACTCGGAGAAGAACG,TGG,0.688,60.0,2.0,95.0,37.0,0.587,0.06,1.0,0,0,0,7,False,False,False,PASS AKT1_3,AKT1,kinase_targeting_flagged,TGTCATGGAGTACGCCAACG,GGG,0.6632,55.0,2.0,97.0,74.1,0.35,0.35,1.0,0,0,1,0,False,False,True,FLAG可见guide_type区分kinase_targeting与kinase_targeting_flaggedguide_verdict给出PASS/FLAG终审结论AKT1_3 因存在 1 个高 CFD 编码区脱靶位点flag_coding_offtargetTrue被标记 FLAG但仍保留在文库中。对照 guide 的类型包括 NTC、safe-harbor/intergenic 切割对照以及阳性对照必需基因RPL/RPS、POLR2A、蛋白酶体亚基等和泛必需激酶CDK1、PLK1用于筛选质量基准校验。质量控制与全基因组脱靶分析靶向侧 QCguide_ontarget_qc.csvguide_ontarget_qc.csv2,072 行 表头对每条 guide 计算 5 类靶向指标Rule Set 2Azimuth分数、GC 含量、同聚物长度max_homopolymer、poly-TTTTT终止子检查、BsmBI/Esp3ICGTCTC酶切位点冲突并额外记录 guide 所在外显子exon 列。每项检查对应一个布尔 flagflag_homopolymer、flag_GC_extreme、flag_lowRS2、polyT_TTTT、BsmBI_site。例如 AKT2_3GGGGGGTAGAGTCTGATCAG因 6-nt 同聚物被flag_homopolymerTrue标记AKT3_1 的 GC 含量仅 25%但未触发 GC 极端阈值仍为 PASS。脱靶侧分析offtarget_report.csv 与 offtarget_coding_hits.csvofftarget_report.csv2,072 行 表头是脱靶分析的逐 guide 汇总核心列包括错配分级计数ot_0mm~ot_3mm0/1/2/3 错配的近似位点数、n_perfect_sites编码区风险n_ot_exonic外显子命中数、n_ot_coding编码区命中数、max_ot_cfd最强脱靶位点的 CFD 分数、max_cfd_coding_ot最强编码区脱靶 CFD特异性汇总CFD_specificity、MIT_specificity分数越高越特异风险判定flag_multicut、flag_coding_offtarget、offtarget_highrisk。从数据分布看特异性差异很大AKT2_4 的 MIT 特异性为 100、CFD 特异性 91.0是全库最干净的 guide 之一而 AKT3_1 在 3-错配级别有 29 个近似位点、CFD 特异性仅 12.5——但它没有编码区命中n_ot_coding0故仍判 PASS。offtarget_highriskTrue的 128 条 guide6.2%构成高风险集合它们在设计哲学上被「保留 注释」而非直接丢弃因为每基因维持 ≥4 条 guide 的统计功效优先于逐条剔除。其中 135 个高 CFD 编码区脱靶位点的明细单独落盘为 offtarget_coding_hits.csv。缺口与补救denovo_design_worklist.csvdenovo_design_worklist.csv37 个基因、53 条 guide记录两类缺口absent_from_Brunello如 CDK8、GRK1、PRKY、STK38——Brunello 中完全没有对应 guide与low_quality_or_specificity如 NEK2、OBSCN、PINK1——已有 guide 因质量/特异性不足被淘汰。表内n_pass_guides与n_guides_needed明确给出每条基因还需补几条 guide例如 BMPR1A、BRD4、BRSK1、CAMK1 等均只需再补 1 条。构建协议从 oligo 池到慢病毒文库construction_protocol.md 给出了可直接进湿实验的六步流程。1. Oligo 池设计83-mer 架构每条 83-nt oligo 的架构为5-[AGGCACTTGCTCGTACGACGCGTCTCACACCG]-[20-nt spacer]-[GTTTAGAGACGTTAAGGTGCCGGGCCCACAT]-3 fwd amplification BsmBI CACCG overhang BsmBI AAAC overhang rev amplification关键技术要点两个 BsmBI 识别位点正向CGTCTC、反向GAGACG朝内排列酶切后切除适配器并留下与 BsmBI 线性化 lentiGuide-Puro 互补的 4-nt 悬垂CACCG/AAACCACCG悬垂同时提供 U6 启动子 Pol III 转录所需的1 G因此 spacer 无需以 G 开头9 条靶向 spacer 以TCTC开头会与...CACCG适配器尾融合形成第三个 BsmBI 位点故在 oligo_pool_synthesis.csv 中标记needs_separate_cloningTrue需用 BbsI 反应单独克隆由于每个受影响基因仍保留 ≥2 条其他 guide从主池剔除它们不会让任何基因低于 2 条 guide 的底线池内其余序列无内部 BsmBI 位点8 条含内部 BsmBI 的 NTC 在设计阶段即被移除。合成寡核苷酸池可从 Twist Bioscience、GenScript 或 CustomArray 订购约 3,129 × 83-mer下单文件为oligo_order.txt。2. 池扩增低循环/乳液 PCR重悬至 1 ng/µL用匹配外侧适配器的引物扩增循环数压到 ≤15–18 个并分散到 ≥8 个平行 50-µL 反应中以抑制 PCR 偏斜与 jackpotting 效应凝胶验证单一条带后用纯化柱或 1.0× AMPure XP 纯化。3. Golden-Gate 组装BsmBI每个 20-µL 反应的配方组分用量lentiGuide-Puro预去磷酸化或单管 GG100 ng扩增后的 insert 池insert:vector 摩尔比 ≈ 2:1Esp3IBsmBI1 µLNEBT4 DNA Ligase1 µLT4 Ligase Buffer10×2 µL热循环30–50 轮37 °C 5 min → 16 °C 5 min随后 37 °C 15 min、65 °C 15 min热灭活。用异丙醇沉淀或 0.7× AMPure 纯化10 µL 洗脱。4. 转化与代表度电转导入Endura 或 Lucigen电转感受态E. coli≥10¹⁰ cfu/µg反应次数需保证≥300× 代表度目标≥938,700 个独立菌落3,129 guide × 300×。刮板前须先铺梯度稀释板计数 cfu 确认覆盖再刮取大生物测定板上的全部菌落midi/maxi-prep 提取质粒。5. 覆盖度 QC对质粒池做 spacer 区扩增子 NGS≥500 reads/guide。验收标准90–95% 的 guide 被检出、偏斜比90th/10th 百分位 10、Gini 指数 0.1偏斜或丢失过度则重新克隆。6. 慢病毒生产在 HEK293T/293FT 中按标准比例4:3:1 或 4:2:1共转染文库质粒 psPAX2gag-pol pMD2.GVSV-G48 h 与 72 h 两轮收获病毒上清0.45-µm 过滤必要时浓缩分装后 −80 °C 保存在目标细胞系上以嘌呤霉素抗性克隆计数做功能滴定确定 MOI ≈ 0.3 所需的病毒体积。关键参数汇总参数值唯一 sgRNA 数3,129Oligo 长度83 nt克隆酶Esp3I / BsmBI骨架lentiGuide-Puro / lentiCRISPRv2克隆代表度≥300×≥938,700 菌落单独克隆 guide9 条TCTC 开头BbsI筛选规模与测序深度规划sequencing_depth_plan.csv 是一个 3×3 场景矩阵克隆/筛选代表度 × reads/guide用于回答「要做多大规模、花多少测序预算」代表度 × reads/guide维持细胞数MOI 0.3 起始细胞数gDNA/样本PCR 孔数(200 ng)9 样本总 readsNovaSeq SP 占比300× / 300938,7003,621,7826,195 ng318,448,3001.06%300× / 1,000938,7003,621,7826,195 ng3128,161,0003.52%500× / 1,0001,564,5006,036,30310,326 ng5228,161,0003.52%1,000× / 1,0003,129,00012,072,60720,651 ng10428,161,0003.52%README 采纳的默认配置是≥500× 代表度每重复 1.56M 细胞MOI 0.3 1,000 reads/guide总 reads 与 readout PCR、样本多重化9 个样本 条件 × 重复 × 时间点一并打包进深度计算器。coverage_vs_cells.png即对应此矩阵的可视化。注意维持细胞数与代表度呈正比代表度 × guide 数而起始细胞数需按 MOI 0.3 反推考虑嘌呤霉素存活这解释了为何 1,000× 时起始细胞数高达 1,200 万——这是保证「每个 guide 都有足量独立转导事件」的统计底线。图形交付物与设计报告六张图覆盖设计全链路均可从上述 CSV 复现kinome_groups.png—— 522 个激酶基因按 Manning 分组TK/TKL/STE/CK1/AGC/CAMK/CMGC/atypical 等的计数分布对应基因集定义阶段guides_per_gene.png—— 每基因 guide 数分布暴露覆盖缺口ontarget_score_distributions.png—— Rule Set 2 分数与 GC 含量分布offtarget_specificity.png—— CFD/MIT 特异性与高危 guide 的标注library_composition.png—— 3,140-sgRNA 文库组成靶向 NTC 阳性对照coverage_vs_cells.png—— 测序深度矩阵的规模-成本曲线。以上全部内容六图 每个参数被汇总进自包含的 design_report.html大体积原始表以文件名引用而不内嵌。在 Feynman 项目中的定位open-science-seeds 机制这个设计包并非孤立文档而是 Feynman 项目「开放科学种子open-science seeds」体系的组成部分。在 src/workbench/seed-fixtures.ts 中可以看到其工程化支撑常量OPEN_SCIENCE_SEED_FIXTURE_DIR fixtures/open-science-seeds与OPEN_SCIENCE_SEED_WORKSPACE_DIR outputs/open-science-seeds定义了种子源目录与工作区目标目录的映射OPEN_SCIENCE_SEED_WORKFLOWS列出四个示例工作流example_crispr_screen、example_enzyme_engineering、example_extremophile、example_immunotherapyensureOpenScienceSeedFixtures()采用只复制、不覆盖的策略对源目录递归遍历若目标文件已存在则跳过skippedFiles否则创建目录并复制copiedFiles返回包含workflowCount、fileCount的统计结果。此外src/workbench/onboarding.ts 将example_crispr_screen列为新用户引导时可用的种子之一src/workbench/scan.ts 则识别outputs/open-science-seeds/前缀下的工件。也就是说这套 CRISPR 设计包作为 Feynman 的可复现研究产物reproducible research artifacts随仓库分发并在首次使用时被播种到用户工作区的outputs/open-science-seeds/下与 AI 研究代理的自动研究工作流形成闭环——用户既可以把它当作现成的筛选设计模板也可以把它当作「AI 设计 → 结构化交付物」输出范式的参考基准。实战参考如何复刻或复用这套设计流程对本设计包的复用路径可以归纳为三条直接使用交付物将 final_kinome_library.csv 与 oligo_pool_synthesis.csv 作为下单与建库的输入按 construction_protocol.md 执行湿实验并按 sequencing_depth_plan.csv 制定测序预算作为设计流程模板参考 plan 工作流 的 8 阶段基因集 → Brunello 子集 → 靶向 QC → 脱靶预测 → 重选与对照 → 构建计划 → 转导/测序规划 → 报告汇总把同一套管线迁移到其他基因家族如磷酸酶组、表观遗传组作为 Feynman 工作区种子在 Feynman 中通过引导流程将example_crispr_screen播种到outputs/open-science-seeds/在此基础上让研究代理基于已有交付物继续开展后续分析。需要说明的适用前提本设计针对人类、SpCas9/NGG、每基因 4 guide的默认假设若切换到其他物种、Cas 变体或基因密度策略如每基因 6–10 guide 的深度筛选脱靶枚举参数、代表度与测序预算都需要按 sequencing_depth_plan.csv 中的公式重新计算。赞分享【免费下载链接】feynmanThe open source AI research agent.项目地址https://gitcode.com/gh_mirrors/feynman/feynman点击查看免费下载相关推荐如何快速上手 easy-sharing3分钟学会在命令行中分享文件到手机如何快速上手 easy sharing3分钟学会在命令行中分享文件到手机 easy sharing 是一款强大的命令行工具让你无需额外客户端应用即可轻松将RuoYi-Vue Pro微服务架构深度解析企业级快速开发平台的最佳实践演进RuoYi Vue Pro微服务架构深度解析企业级快速开发平台的最佳实践演进 在数字化转型浪潮中企业级应用开发面临多租户支持、高并发处理、业务快速迭代等核心后端前端代码生成3分钟免费激活Windows和OfficeKMS_VL_ALL_AIO终极指南3分钟免费激活Windows和OfficeKMS_VL_ALL_AIO终极指南 还在为Windows系统激活而烦恼吗面对Office试用期结束却不想付费的困上一篇终极指南用Python的toolz库构建实时数据分析平台下一篇AData快速入门指南10分钟学会获取股票代码和实时行情创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考