尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

AI Agent_3 Agent 核心组件 详细讲解

发布时间:2026/9/29 7:35:00

资讯中心
01
ARTICLE

AI Agent_3 Agent 核心组件 详细讲解

AI Agent_3 Agent 核心组件 详细讲解
一、AI Agent 是什么先建立直觉AI Agent智能体 一个大模型作为大脑 一套能感知、能行动、能记忆、能自我修正的 身体。普通聊天机器人你说一句它回一句说完就忘不会调用任何外部能力。 AI Agent你说一个目标比如 帮我规划五一去云南的行程它会把目标拆解成多个步骤自己决定去查天气、查机票、查景点把结果整合成完整方案交给你还能根据你的追问修正方案。维度传统聊天机器人AI Agent交互模式一问一答多步自主执行一个目标记忆无每轮重新开始短期 长期记忆外部能力无只靠模型内部知识可调用搜索、代码、API 等工具规划无任务分解、反思、纠错反馈不观察结果观察工具结果并据此调整Agent 的四个基本步骤几乎所有 Agent 都是这个循环感知接收并理解输入文字 / 图像 / 语音 / 环境状态思考结合记忆和知识推理、规划、决定下一步行动输出回答或调用工具执行操作观察读取行动结果验证是否达到目标未达成则回到第 2 步继续二、核心组件全景图下面这张图展示了 Agent 的六大核心组件及它们之间的数据流示意 图非官方标准结构三、逐一拆解六大核心组件含示例与机理组件一感知层 —— 让 Agent 看得到、听得到、读得懂感知层负责把人类世界的各种输入文字、图像、声音转换成大模型能理解的数字向量。因为大模型本质是数学函数它只认识数字不认识 字 和 像素。输入类型转换机制产物文本Tokenizer 分词把句子切成子词单元如 我喜欢 AI → [我喜欢AI]再查词表映射成向量token 序列图像切成固定大小的小块patch每个 patch 经过视觉编码器如 ViT/CLIP转成向量加位置编码视觉特征序列语音音频波形 → 分帧 → 梅尔频谱图 → 声学编码器如 Whisper 的编码器声学特征序列示例 1图像描述生成Image Captioning场景你给 Agent 一张 公园里孩子在放风筝 的照片让它输出一段描述。步骤 1切块图像被切成 14×14 像素的小方块类似拼图每个小方块是一块 图像单词。步骤 2编码每个小方块经过视觉编码器如 ViT 或 CLIP变成一个向量整张图变成一串带空间位置的向量序列。这一步模型 看到 了图的底层特征边缘、颜色、形状和高级语义人、风筝、天空。步骤 3对齐通过投影层把图像向量映射到和文本向量相同的 语义空间这样模型才能把 图里的东西 和 语言里的词 对应起来。步骤 4生成这些视觉向量作为 前缀 进入大模型的注意力层模型开始自回归地逐词生成描述 —— 每生成一个词都结合前面已生成的词和整张图的视觉信息选概率最高的下一个词直到生成结束符。实际价值帮助视障人士 看懂 图片电商自动生成商品描述内容审核自动识别违规图片并生成说明。示例 2语音转文字ASRAutomatic Speech Recognition场景你给 Agent 一段 30 秒的会议录音让它转成文字稿。步骤 1采样模拟声波按 16kHz 采样率变成数字序列每秒 1.6 万个数字点。步骤 2特征提取把波形按 25 毫秒一帧切分每帧计算 梅尔频谱—— 本质是把声音按音高频率展开成一张 频率 × 时间 的二维图突出人耳敏感的频率范围。这相当于把声音变成了 声谱图。步骤 3声学编码声谱图送入声学编码器如 Whisper 用编码器 - 解码器 Transformer把声学特征编码成向量序列。步骤 4序列对齐与解码模型通过注意力机制把 声音的哪一段对应哪个字 对齐起来再结合语言模型逐字解码带上下文纠正同音字如 行程vs形成。实际价值会议纪要、视频字幕、语音助手听懂你说话是第一步。组件二认知层 —— Agent 的 大脑认知层就是大语言模型LLM本身负责理解、推理、规划、决策。它决定 Agent 的 聪明程度。几个关键机制思维链Chain-of-Thought, CoT让模型 先想清楚再回答—— 把推理过程一步步写出来而不是直接给答案。这大幅提升复杂逻辑问题的正确率。ReActReasoning Acting思考Reasoning和行动Acting交替进行 ——我先想想该干什么 → 好去调用工具 → 看到结果 → 再想想 → 再行动…… 这是 Agent 最主流的运行范式。意图理解与任务分解把模糊的请求解析成明确目标再拆成可执行的小步骤。示例 3图文问答VQAVisual Question Answering场景你上传一张 厨房台面上有鸡蛋、面粉、牛奶 的照片问 能做什么菜步骤 1双路编码图像走视觉编码器 → 视觉向量序列问题 能做什么菜 走文本编码器 → 文本向量序列。步骤 2跨模态融合这是关键 —— 模型用跨模态注意力cross-attention机制让 菜 这个字去 关注 图像中鸡蛋、面粉、牛奶的区域同时让图像特征去对齐问题的语义。两者在注意力层里互相加权、深度融合形成 图文联合表示。步骤 3生成模型基于融合后的表示生成 可以煎蛋饼、做牛奶面包…… 等答案回答还会结合常识鸡蛋 面粉 牛奶 煎饼的材料。实际价值拍照问 这药怎么吃结合 OCR 认药名质检员拍产品图问 有没有缺陷学生拍题问 这题怎么做。注意对比示例 1图像描述是 图 → 一段完整描述图文问答是 图 特定问题 → 针对性答案。区别在于问题的文本向量参与了融合把模型的注意力 引导 到了相关区域。组件三记忆系统 —— Agent 的 档案室没有记忆的 Agent 每轮对话都是 失忆 的。记忆系统分三种类型存储位置作用比喻短期记忆上下文窗口prompt 中的对话历史记住本轮对话便利贴长期记忆向量数据库Embedding 检索跨会话记住用户与知识档案室工作记忆Agent 运行时状态当前任务的中间步骤草稿纸长期记忆的核心机制是RAG检索增强生成写入把知识 / 历史记录切成小块 → 每块用 Embedding 模型转成向量 → 存入向量数据库如 FAISS、Milvus。检索用户提问 → 问题同样转成向量 → 用余弦相似度找出最相关的 Top-K 文本块。注入把检索到的文本块拼进 prompt 作为背景知识。生成LLM 基于 问题 检索到的资料 回答答案可溯源。示例 4客服 Agent 记住用户偏好场景用户周一问过 我过敏推荐不含花生的零食周五又来说 再推荐几款。没有记忆的 Agent周五完全忘记过敏史可能推荐含花生的产品 → 危险。有长期记忆的 Agent周五收到消息 → 检索到周一的对话记录过敏、不含花生→ 注入上下文 → 推荐 无花生坚果棒、米饼并主动说 这次避开了含花生成分。实际价值个性化体验、连续服务、减少用户重复说明企业知识库问答回答基于内部文档而不是模型瞎编还能给出处。组件四工具与行动层 —— Agent 的 手这是 Agent 与聊天机器人的根本区别能调用外部工具改变现实世界。核心机制是Function Calling函数调用声明工具开发者把工具写成 JSON Schema—— 工具名、参数、用途说明例如天气工具{name:get_weather,parameters:{city:string}}。模型决策LLM 看到用户需求后不直接执行而是输出一个结构化调用请求例如{name:get_weather,arguments:{city:青岛}}。框架执行Agent 框架收到这个请求在沙箱 / 服务端真实调用该函数拿到结果如 青岛 24°C 晴。结果回填工具结果作为 观察 拼回上下文LLM 继续推理最终组织成自然语言回答。工具类型搜索联网查最新信息、代码执行Python 沙箱用于计算 / 分析、数据库查询、外部 API天气 / 地图 / 支付、软件操作点击网页、发送邮件等。2024 年后MCP模型上下文协议成为统一工具接入标准让 Agent 像 USB 插口一样即插即用各类工具。示例 5旅行规划 Agent多工具 ReAct 循环用户帮我规划五一去云南玩 4 天预算 5000。Agent 的实际运行轨迹每次循环 思考→行动→观察轮次思考Thought行动Action观察Observation1需要先确认时间与天气调用search(昆明 五一 天气)5 月天气温和适合出行2需要订机票和住宿调用get_flights(青岛→昆明, 5/1)、get_hotels(昆明, 4晚)机票往返约 1800住宿约 12003需要安排景点调用search(云南 4天 经典路线)昆明→大理→丽江线路推荐4预算还剩约 2000需标注调用calc(5000-1800-1200)剩余 20005信息齐了停止调用整理输出生成完整行程表 预算清单机制要点每一轮的 观察 都成为下一轮 思考 的依据 —— 这就是 ReAct 循环。Agent 不是一次性生成答案而是像人一样边查边想。实际价值答案基于实时真实数据天气、票价不是模型记忆里的过时信息能完成需要 多步操作 的任务。示例 6数据分析 Agent代码执行 自我修正用户上传一个销售数据.csv说 分析各季度销售趋势并画图。第 1 轮Agent 思考 需要用 pandas 读取数据 → 调用代码执行工具生成并运行 Python 代码。观察代码报错 找不到列名 日期 实际叫 Date → Agent 反思并修正代码。第 2 轮重新运行 → 成功算出各季度销售额 → 再生成 matplotlib 代码画折线图 → 观察图表生成成功 → 输出结论 Q3 增长 30%主要受促销带动。机制要点工具结果包括报错信息是 Agent 的 观察它把错误当作反馈来修正自己 —— 这叫试错学习是 Agent 能完成复杂实操任务的关键。实际价值不会写代码的用户也能做数据分析Agent 可执行 写代码→运行→看结果→改代码 的真实工作流。组件五规划与决策 —— Agent 的 项目经理任务分解Plan-and-Execute先制定完整计划再执行区别于 ReAct 的走一步看一步。例如 写市场报告→ 计划 [1 调研 2 列大纲 3 撰写 4 校对]逐项执行并跟踪进度。反思Reflection / Reflexion执行完一阶段后Agent 对比 实际结果 vs 目标找出差距把反思结论存入记忆下一轮改进。就像学生做完题后对答案、改错题。多智能体协作Multi-Agent让多个 Agent 扮演不同角色策划、执行、审校分工合作各司其职例如一个 Agent 写文案、另一个负责检查事实错误。组件六反馈与学习 —— Agent 的 复盘机制执行级反馈工具调用失败 → 换参数重试或换工具结果不符合预期 → 反思后调整策略。用户级反馈用户说 不对我要的是便宜的 → Agent 修正条件重新执行。长期学习从用户历史反馈中总结偏好存长期记忆甚至通过 RLHF 等方式优化模型本身。四、串联起来一个 Agent 的完整工作流以 语音 图片混合请求 为例把六个组件串起来用户对着手机说帮我看看这张体检单箭头标高的项严不严重 并拍了照片。感知ASR 把语音转成文字视觉编码器 OCR 读取体检单图片 → 两类信息都进入上下文。思考认知核心理解意图 要解读体检指标检索长期记忆该用户的历史体检数据。规划决定步骤①认指标→②查参考范围→③对比历史→④评估风险。行动调用工具查询医学知识库 / 权威资料获取各指标标准值。观察对照结果判断哪些指标超标、幅度多大。输出生成 3 项偏高其中血糖需重视建议就医复查 的语音 文字回复。反馈若用户追问 那饮食上注意什么新一轮循环启动继续检索、回答。五、实际价值与主要挑战价值把大模型从 只会说话的百科全书 升级为 能办事的助理—— 查实时信息、操作软件、执行代码、记住用户、多步完成任务。这是 2024 年以来大模型落地到工作生活的核心形态。挑战新手也要知道幻觉模型可能编造不存在的事实所以关键任务要配合工具检索和结果核验RAG 工具调用就是防幻觉手段。工具执行风险Agent 的操作可能有真实后果付款、发消息、删文件所以需要权限控制与沙箱隔离。上下文限制上下文窗口有限对话太长需要压缩或外置记忆。安全与对齐防止 Agent 被恶意提示词诱导做有害操作需要安全过滤和人类监督。
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。