尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

【AI黑话日日新】Day 044|GRPO(分组相对策略优化)

发布时间:2026/9/27 3:13:14

资讯中心
01
ARTICLE

【AI黑话日日新】Day 044|GRPO(分组相对策略优化)

【AI黑话日日新】Day 044|GRPO(分组相对策略优化)
一句话说清:让模型自己跟自己比,哪条回答更得分就多学哪条。1. 它到底在说什么GRPO 是英文 Group Relative Policy Optimization 的缩写,中文译作“分组相对策略优化”。它是一种用来微调大语言模型的强化学习算法,核心思路可以概括成一句话:对同一个问题,让模型一口气生成好几条回答,再拿它们的得分互相比较,得分高于“小组平均分”的就多学一点,低于平均的就少学一点。用一个生活化的类比来理解:传统做法像请一位私教(评论家)盯着你每一次练习,给你逐拍打分;GRPO 则像把一个学习小组放在一起——不请私教,而是让这一组人互相比。某人这次做得比同组平均水平好,就被认为“方向对”,下次更可能这么做;比平均差,就被认为“方向偏”,下次压下去。谁好谁坏,由组内相对位置决定,不需要额外请一位裁判。2. 为什么现在这个词很热GRPO 的走红有一条清晰的时间线。2017 年,OpenAI 的 John Schulman 等人提出 PPO(Proximal Policy Optimization,近端策略优化,arXiv:1707.06347),成为后来 RLHF(Reinforcement Learning from Human Feedb
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。