尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

大模型算法工程师入行指南:微调、RAG与Agent实战学习路径

发布时间:2026/9/26 3:20:00

资讯中心
01
ARTICLE

大模型算法工程师入行指南:微调、RAG与Agent实战学习路径

大模型算法工程师入行指南:微调、RAG与Agent实战学习路径
1. 大模型算法工程师到底在做什么先把一个最常见的误解说清楚大模型算法工程师不等于“训练大模型的人”。这个岗位的真实工作内容在不同公司、不同团队之间差异极大但核心可以归为四类预训练与继续预训练、监督微调与对齐、推理优化与部署、以及基于大模型的应用层开发RAG、Agent、评测体系。市面上绝大多数挂着“大模型算法工程师”头衔的岗位实际做的是后两类尤其是应用层开发和微调落地。我见过太多人一上来就问“怎么从零训练一个GPT”这个问题本身就偏了。且不说算力成本单是数据清洗和配比这一项就够一个十人团队干上半年。对于个人入行来说真正务实的切入点是先搞清楚大模型的能力边界再学会用微调、RAG、Agent这些手段去解决具体业务问题。这才是当前市场招聘量最大、门槛相对可控的方向。从薪资维度看这个岗位目前处于明显的溢价期。一线城市应届硕士做应用层方向年包普遍在30到50万之间有两年以上微调或推理优化经验的60到90万是常见区间真正做过千卡以上预训练、能独立设计训练方案的资深工程师年包过百万并不罕见。但要注意这个溢价来自供需失衡不是来自岗位本身的“技术含量”就一定比后端、推荐算法高多少。供需关系会变化所以入行时选对细分方向比单纯追薪资更重要。适合读这篇内容的人我大致分三类一是计算机相关专业的在校生想提前规划学习路线二是后端或数据方向想转行的工程师需要知道补哪些短板三是已经在做AI应用但缺乏系统认知的开发者想把RAG、Agent这些概念串成体系。下面我会按“整体设计思路—核心技术点—实操路径—常见坑”的顺序展开尽量把每个环节的“为什么”讲透。2. 整体学习路径与方向选型2.1 先分清三个容易混淆的概念热词里反复出现“agent和llm和ai模型有什么区别”“比如常说的deepseek是属于哪个”这个问题必须先厘清否则后面学习会一直混乱。大模型LLM指的是经过大规模预训练的神经网络比如DeepSeek、Qwen、Llama这些它们本质是一个“下一个token预测器”输入一段文本输出概率分布。它本身不会主动做事也不会记住你的对话历史每次调用都是独立的。AI模型是个更宽泛的概念传统机器学习模型、CV模型、语音模型都算。LLM只是AI模型的一个子集。所以问“DeepSeek属于哪个”答案是DeepSeek是一个LLM也是一个AI模型但它不是Agent。AI Agent是在LLM之上加了一层“决策与执行循环”的系统。它让LLM不仅能生成文本还能调用工具、查询数据库、执行代码、根据结果决定下一步动作。Agent的核心不是模型本身而是规划、记忆、工具调用这三件事的组合。一个Agent可以基于DeepSeek构建也可以基于Qwen构建模型只是它的“大脑”之一。用一句话概括LLM是发动机AI模型是包含发动机在内的所有动力装置Agent是装了发动机还能自己决定去哪的车。2.2 方向选型的三个现实考量选方向不能只看热度要看三个东西你的现有基础、目标岗位的招聘量、以及这个方向的技术护城河能维持多久。如果你数学和分布式系统基础扎实能读懂Transformer源码那可以往预训练或推理优化走这条路门槛高但护城河深。如果你工程能力强、对业务理解快那RAG和Agent方向更适合招聘量大、上手快但需要持续跟进框架迭代。如果你还在校、时间充裕建议先把微调跑通一遍再选一个应用方向做深。这里有个经验判断纯Prompt工程的门槛正在快速降低单纯会写提示词已经不够了。市场需要的是能把RAG召回率从60%优化到85%、能把Agent的工具调用成功率提上去、能设计评测体系量化效果的人。所以学习重点要放在“调优”和“评测”上而不是“会用”。2.3 一张学习路线表的取舍逻辑网上流传的大模型学习路线图动辄几十个节点看着就劝退。我建议按“最小可用闭环”来组织阶段核心目标关键内容建议投入第一阶段建立直觉Transformer结构、注意力机制、tokenization2周第二阶段跑通微调LoRA/QLoRA、数据集格式、训练参数3周第三阶段搭建RAG向量库、切分策略、召回与重排3周第四阶段构建Agent工具调用、规划循环、记忆管理4周第五阶段评测与优化评测集设计、指标计算、badcase分析持续这个顺序的逻辑是先懂原理再动手先单点跑通再系统集成最后用评测驱动优化。跳过任何一步都会在后面还债。比如不懂注意力机制调微调参数时就是瞎试不做评测RAG优化就没有方向。3. 核心技术点深度拆解3.1 微调什么时候该做什么时候不该做大模型微调是热词里出现频率最高的词之一但很多人对它的适用场景有误解。微调不是万能的它擅长的是“改变模型的输出风格和格式”不擅长“注入新知识”。想让模型记住你公司的最新产品文档正确做法是RAG不是微调。想让模型按你规定的JSON格式输出、用你品牌的语气说话微调才合适。微调方法上全参数微调需要多卡A100/H100个人基本玩不起。LoRA和QLoRA是个人和小团队的主流选择。LoRA的原理是在原模型权重旁挂一个小矩阵训练时只更新这个小矩阵参数量能降到原模型的0.1%到1%。QLoRA在此基础上把原模型量化到4bit进一步降低显存需求。实测下来7B模型用QLoRA微调单张24G显存的消费级卡就能跑比如RX 6750 GRE这类卡虽然生态支持不如N卡但通过特定框架也能勉强跑通小规模实验。微调的关键参数我列几个必须理解的rank秩LoRA矩阵的维度常用8到64。太小欠拟合太大容易过拟合且显存上升。alpha缩放系数通常设为rank的2倍。它控制LoRA权重对原模型的影响程度。learning rate微调学习率比预训练大常用1e-4到2e-4。太大loss震荡太小收敛慢。target modules决定给哪些层加LoRA。通常加在q_proj、v_proj上效果和成本的平衡最好。数据集格式是另一个坑。很多人拿几百条数据就想微调结果模型直接过拟合换个问法就答错。微调数据量建议至少1000条以上且要覆盖目标场景的各种表达方式。数据质量比数量重要一条脏数据的影响可能抵消十条好数据。3.2 RAG召回质量决定上限RAG检索增强生成是目前企业落地最多的方案核心流程是文档切分→向量化→存入向量库→用户提问时召回相关片段→拼进提示词→LLM生成答案。看起来简单但每个环节都有讲究。切分策略是第一个关键点。按固定字数切分最省事但会把完整语义切断。更好的做法是按语义切分比如按段落、按标题层级或者用递归切分保留上下文。切分粒度上经验值是每段300到500字太小召回信息不全太大引入噪声。向量模型选择直接影响召回质量。中文场景下BGE系列、M3E系列是常用选择。选型时要看两个指标检索准确率和推理速度。有些模型准确率高但推理慢在实时场景下不可用。召回与重排是提升效果的核心手段。单纯向量召回会有语义漂移加入BM25做混合召回能提升关键词匹配的准确度。再上一层用重排模型如bge-reranker对召回结果精排能把Top5的准确率提升10到20个百分点。这套“混合召回重排”的组合是我实测下来性价比最高的优化路径。热词里提到“rag和mcp区别”这里顺带说一句RAG解决的是“知识从哪来”的问题MCP模型上下文协议解决的是“模型怎么标准化地调用外部工具和数据源”的问题。两者不冲突RAG可以作为MCP的一个数据源被Agent调用。3.3 Agent从“会聊天”到“会做事”Agent是当前最热的方向但也是最容易做成demo、最难做成产品的方向。一个Agent系统通常包含四个模块规划器、工具集、记忆、执行循环。规划器负责把用户目标拆成子任务。简单场景用ReAct模式推理行动交替复杂场景需要任务分解和依赖管理。工具集是Agent的手脚可以是搜索、代码执行、数据库查询、API调用。记忆分短期当前对话和长期跨会话的知识沉淀长期记忆通常用向量库实现。热词里“从0到1搭建ai agent”是很多人的需求。我的建议是先用现成框架跑通一个最小闭环比如用LangChain或AgentScope搭一个能查天气、能算数的Agent理解工具调用的完整链路。然后再逐步替换组件比如把默认的规划器换成自己写的、把工具集扩展成业务相关的。Agent开发中最难的不是“让它动起来”而是“让它稳定地动”。LLM的输出有随机性工具调用可能失败多步任务中间某一步出错会导致整个链路崩溃。所以错误处理和重试机制是Agent工程化的核心。我通常会给每个工具调用加超时和重试给规划器加最大步数限制给整个循环加兜底回复。3.4 评测没有评测就没有优化这是最容易被忽视、但最重要的一环。很多人做完RAG或Agent凭感觉说“效果还行”但一问具体指标就说不出来。没有量化评测优化就是盲人摸象。评测体系分三层检索层看召回率和准确率生成层看答案相关性和忠实度端到端看任务完成率和用户满意度。检索层可以用标注好的问答对来算Hit Rate和MRR。生成层可以用LLM-as-Judge让强模型给弱模型的输出打分但要注意评委模型的偏见。端到端评测最接近真实场景但成本最高。我自己的做法是先建一个50到100条的评测集覆盖典型场景和边界情况每次改动都跑一遍看指标是涨是跌。这个评测集要持续维护badcase发现一个加一个。这样优化才有方向也才能向团队证明改动的价值。4. 实操路径与关键环节4.1 环境准备别在第一步卡住个人做实验环境配置是第一个拦路虎。我的建议是优先用云GPU按小时计费而不是一上来就买卡。原因很简单你前期大部分时间在写代码和调试真正跑训练的时间占比不高买卡闲置成本太高。等确定要长期投入了再考虑本地部署。如果坚持本地部署显存是硬约束。7B模型全精度推理需要约14G显存4bit量化后约4到6G。微调时QLoRA的显存占用约为推理的1.5到2倍。所以一张24G的卡能覆盖7B模型的微调和13B模型的量化推理。热词里提到的“rx6750gre训练大模型”这张卡12G显存跑7B的QLoRA比较勉强需要调小batch size和序列长度且生态支持不如N卡顺畅踩坑概率高。Python环境用conda管理PyTorch版本要和CUDA匹配。这一步网上教程很多核心原则是先确定显卡驱动支持的CUDA版本再选对应的PyTorch最后装其他依赖。顺序反了就会陷入版本地狱。4.2 微调实操从数据到模型假设你要微调一个7B模型让它按固定格式回答客服问题。完整流程如下第一步准备数据。格式通常是JSONL每行一个样本包含instruction、input、output三个字段。数据要清洗去掉HTML标签、统一标点、去除重复、检查output是否符合目标格式。我一般会写个脚本做自动检查把不符合格式的样本挑出来人工复核。第二步选择基座模型。中文场景优先选Qwen或DeepSeek系列社区资源多、文档全。模型大小根据显存选7B是个人实验的甜点区。第三步配置训练参数。用LLaMA-Factory或Unsloth这类框架能省很多事。关键配置包括LoRA rank设为16、alpha设为32、learning rate设为2e-4、batch size根据显存尽量大、epoch设为3到5。训练时盯着loss曲线如果loss下降后又上升说明过拟合了要减少epoch或加数据。第四步合并与导出。训练完的LoRA权重可以单独保存也可以合并回原模型。合并后导出为GGUF格式方便在本地用llama.cpp推理。这一步的坑是量化精度选择Q4_K_M是速度和质量的平衡点Q8_0质量更好但更慢。第五步评测。用预留的测试集跑一遍对比微调前后的输出。重点看格式合规率和答案准确率。如果格式合规率上去了但准确率掉了说明微调数据里格式样本太多、知识样本太少需要调整数据配比。4.3 RAG实操从文档到问答RAG的实操我按数据流顺序讲。假设你要做一个公司内部知识库问答。文档入库阶段先把PDF、Word、Markdown等格式统一转成纯文本。PDF解析是第一个坑扫描件需要OCR表格和公式容易解析错。我通常用PyMuPDF做基础解析复杂版式再上专门的工具。解析后按标题层级切分每个片段保留所属章节的路径信息这样召回时能带上上下文。向量化阶段选一个中文向量模型把每个片段编码成向量存入向量库。向量库选型上小规模用FAISS就够大规模用Milvus或Qdrant。存的时候把原文、元数据来源、章节、时间一起存方便后续过滤和展示。检索阶段用户提问后先用向量模型编码问题在向量库里做相似度搜索召回Top20。同时用BM25做关键词召回两路结果合并去重。然后用重排模型对合并结果精排取Top5拼进提示词。生成阶段提示词模板很关键。我通常这样写“基于以下资料回答问题如果资料中没有相关信息请明确说不知道不要编造。资料{context}。问题{question}。”这个“不知道”的兜底很重要能大幅降低幻觉。优化阶段收集badcase分析是召回没召到、还是召回了但生成没用上。召回问题就调切分粒度和召回数量生成问题就调提示词和模型。每次改动都跑评测集用数据说话。4.4 Agent实操从工具调用到任务闭环搭一个最小Agent我建议从“单工具单轮”开始再逐步加复杂度。第一版定义一个查天气的工具让LLM决定什么时候调用。提示词里写清楚工具的用途和参数格式LLM输出工具调用请求后代码执行工具把结果返回给LLMLLM生成最终回复。这个闭环跑通你就理解了Agent的基本原理。第二版加多工具和规划。定义三到五个工具让LLM自己决定用哪个、按什么顺序用。这时候会出现工具选择错误、参数格式错误等问题需要加校验和重试。第三版加记忆。短期记忆用对话历史长期记忆用向量库存历史交互。每次新对话开始时先检索相关历史拼进提示词。第四版加错误处理。每个工具调用加超时失败后让LLM决定是重试还是换工具。整个循环加最大步数防止死循环。最后加兜底回复确保任何情况下用户都能得到响应。这套流程走下来你对Agent的理解会比看十篇文章都深。热词里“ai agent练手小项目”的需求按这个路径做一遍就能满足。5. 常见问题与排查技巧实录5.1 微调相关问题问题一loss不下降。先检查数据格式对不对再看learning rate是不是太小。如果都没问题可能是基座模型和任务不匹配换个模型试试。我遇到过一次是数据里混入了大量空样本导致模型学不到东西。问题二过拟合。表现是训练集loss很低但测试集效果差。解决办法减少epoch、增加数据量、调小rank、加dropout。最根本的还是数据要多样不能都是相似表达。问题三显存不够。依次尝试调小batch size、调短序列长度、开gradient checkpointing、换QLoRA、换更小的模型。如果还不行就上云。5.2 RAG相关问题问题一召回不准。先看切分是否合理再看向量模型是否适合中文。如果都OK加BM25混合召回和重排。我实测下来重排模型对准确率的提升最明显。问题二答案有幻觉。提示词里加“不知道”兜底降低temperature减少召回片段数量。如果还不行检查召回内容里是不是有矛盾信息有的话要在提示词里说明以哪条为准。问题三响应太慢。瓶颈通常在向量检索和LLM生成。向量检索可以加缓存LLM生成可以换小模型或流式输出。重排模型如果太慢可以只对Top10重排而不是Top20。5.3 Agent相关问题问题一工具调用格式错误。提示词里给few-shot示例展示正确的调用格式。加输出解析和校验格式不对就重试。问题二多步任务中途失败。加最大步数限制和超时失败后让LLM总结已完成的部分并给出替代方案。关键操作加人工确认环节。问题三循环调用同一个工具。在提示词里加“不要重复调用相同工具”的约束或者在代码里检测重复调用并强制中断。5.4 一个速查表现象可能原因排查方向微调后模型变傻数据质量差或过拟合检查数据、减少epochRAG答非所问召回不准或提示词不清看重排、改提示词Agent死循环规划器无步数限制加最大步数、加去重推理速度慢模型太大或未量化量化、换小模型、流式显存溢出batch或序列太长调小参数、开梯度检查点6. 入行建议与长期发展6.1 小白入行的最小行动清单如果你现在零基础别急着买课。按这个清单走第一周装好环境跑通一个开源模型的推理理解输入输出。第二周找一个开源微调项目用自己的数据跑一遍理解训练流程。第三周搭一个最简单的RAG用本地文档做问答。第四周搭一个单工具Agent理解工具调用。这四周下来你对大模型应用的完整链路就有了体感再决定往哪个方向深入。学习资源上官方文档永远优先于二手教程。Qwen、DeepSeek、LangChain、LLaMA-Factory的文档都写得不错。论文方面先把Attention Is All You Need和LoRA这两篇读透其他按需查。6.2 面试准备的重点算法工程师面试通常分四块基础原理、项目经验、编程能力、系统设计。基础原理会问Transformer结构、注意力计算、微调方法对比。项目经验要能讲清楚你做了什么、为什么这么做、效果如何、遇到什么问题怎么解决。编程能力考Python和PyTorch可能让你手写注意力或数据加载。系统设计会问“设计一个RAG系统”或“设计一个Agent”考察你的架构思维和取舍能力。我面过不少人发现一个共性问题项目讲得很热闹但一问指标就含糊。准备面试时一定要把项目的量化结果整理清楚比如召回率从多少提升到多少、响应时间从多少降到多少。数据比形容词有说服力。6.3 这个方向还能走多久大模型应用层的机会窗口还在但门槛在快速抬高。一年前会调API就能找到工作现在需要懂微调、懂RAG优化、懂Agent工程化。未来两年单纯会调框架的人会被淘汰能解决实际业务问题、能设计评测体系、能做端到端优化的人会持续稀缺。我的建议是不要把自己定位成“某框架的使用者”要定位成“用大模型解决业务问题的人”。框架会变但问题定义、方案设计、效果评测这些能力是通用的。把基础打牢把项目做深比追每一个新框架更重要。最后分享一个我自己的习惯每学一个新东西就写一篇实操记录把踩过的坑和解决过程记下来。这些记录后来成了我面试时的素材库也成了我带新人时的教材。大模型这个领域变化太快但“动手做过”这件事永远比“看过”有价值。
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。