尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

06 预训练(上):损失、困惑度与训练循环

发布时间:2026/9/4 6:47:15

资讯中心
01
ARTICLE

06 预训练(上):损失、困惑度与训练循环

06 预训练(上):损失、困惑度与训练循环
06 预训练(上):损失、困惑度与训练循环系列第 6 篇。上一篇我们搭好了 GPT 模型的"骨架",但它的参数是随机的——不会说话。这一篇开始预训练:让模型在海量无标注文本上学习"预测下一个词"。对应《从零构建大模型》第 5 章前半部分:文本生成评估、交叉熵损失、困惑度、训练循环、过拟合与验证集。1. 预训练在做什么?预训练的目标非常单纯:给定一段文本的前缀,让模型预测下一个 token。重复亿万次,模型就"学会"了语言。输入: "The cat sat on the" 目标: "mat"用自监督的方式,从语料里自动生成 (输入, 目标右移一位) 的训练对——无需人工标注,这就是它能吃下 TB 级数据的原因。为什么"预测下一个词"能学会语言?正如第 1 篇强调的:这个目标极其"宽泛",为了把它做好,模型被迫学会语法(怎么组句)、语义(词的意思)、常识(什么该接什么)。预训练不是"背课文",而是"在亿万次预测中被迫内化语言规律"。本系列用的是《The Verdict》这种 5 千词小文本做演示,真实 GPT 用的是 40GB+ 的 WebText。/
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。