尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

9月开源大模型密集更新:总参数在涨,激活参数和单位成本却在降

发布时间:2026/9/29 1:35:44

资讯中心
01
ARTICLE

9月开源大模型密集更新:总参数在涨,激活参数和单位成本却在降

9月开源大模型密集更新:总参数在涨,激活参数和单位成本却在降
9月的这波大模型更新如果只看榜单分数会觉得又是熟悉的发布周套路。但把几个国产开源模型放在一起看会看到一个更实在的变化总参数越做越大每次推理真正激活的参数却越来越小与此同时API 的单位成本在往下走缓存命中的价格甚至被砍到了原来的四分之一。对开发者来说这比某模型又刷新了某个基准有用得多。一、这波更新到底改了什么先摆几条有据可查的事实数据均来自公开报道与厂商文档仅供了解趋势智谱 GLM-5.3-FlashGLM-5 系列首个原生多模态模型总参数量约 320B采用 MoE 架构每次推理激活约 18B权重以 MIT 许可证在 Hugging Face 开源API 同步开放。据报道它在正式揭面前曾以匿名代号在 OpenRouter 上冲上过调用量榜首。阿里 Qwen3.8-Flash-Next被官方描述为下一代架构的预览版本据第三方报道约为 125B 总参数、6B 激活主打稀疏注意力、门控残差一类的效率改进第三方盘点给出的 API 价格约为每百万 token 输入 1 元、输出 3 元。Anthropic9 月发布新模型时把提示缓存读取的价格下调了约 75%从此前每百万 token 1 美元降到 0.25 美元标准输入价未变缓存读取价单独下调。把这三条放在一起方向就很清楚了竞争的主战场正在从谁的参数大、谁的分高转向谁能让单位任务更便宜、更快、更稳。二、技术本质MoE 把大和贵解耦了过去大家默认一条公式参数越大 → 能力越强 → 推理越贵。MoE混合专家把这个链条拆开了。MoE 的核心思路是模型里塞很多专家子网络但每次 token 只路由到其中少数几个。于是总参数量决定模型的知识容量存得下多少东西激活参数量决定每次推理的计算量跑一次要花多少钱。320B 总参数、18B 激活意味着知识面按大模型来配账单按小模型来结。这解释了两个现象为什么小激活参数的模型也能打。6B 激活对上一个 300 多 B 的模型单看计算量是小一个数量级但因为专家库够大、训练数据够多实际表现并不差。这里的关键不在参数多少而在路由策略和专家利用率做得好不好。为什么成本能压下来。推理成本大致正比于激活参数数量和输出 token 数量。激活参数一降单位成本自然跟着降再叠加缓存降价长对话、长文档这类场景的实际开销掉得更快。没变的是什么一是碎片化。不同厂商的许可证并不统一——同样是开源MIT 和自定义社区许可在商用、二次分发上的限制差别很大。二是开源这两个字的含金量在缩水不少厂商只放权重、不放训练细节甚至放出的是上一代版本。三是评测分数依然不能直接换算成你业务里的效果。三、对开发者意味着什么以及几个真实的坑第一选型要算单位任务成本不是单 token 价格。单价低的模型如果为了想清楚问题而输出一堆思考过程总账可能反而更贵。据公开报道就有新模型在把缓存价格砍掉 75% 的同时因为输出 token 变多单个复杂任务的总成本反而比上一代高了约 20%。所以看价目表时要同时盯住三个量输入价、输出价、以及平均输出 token 数。下面这段代码可以拿来粗算一个场景的单位成本价格换成你自己拿到的价目表即可defcost_per_task(input_tokens,output_tokens,cached_tokens,price_in,price_out,price_cached):price_* 单位元 / 百万 tokencached_tokens 为命中缓存的部分non_cachedmax(input_tokens-cached_tokens,0)return(non_cached/1e6*price_incached_tokens/1e6*price_cachedoutput_tokens/1e6*price_out)# 同一个任务两个模型的对比数字为示意请替换为实际价目表acost_per_task(8000,1500,6000,price_in5,price_out25,price_cached0.25)bcost_per_task(8000,3000,6000,price_in1,price_out3,price_cached0.1)print(fA 模型单任务约{a:.4f}元B 模型单任务约{b:.4f}元)第二有缓存就用缓存但要理解缓存的语义。缓存省钱的前提是前缀稳定系统提示词、工具定义、长文档这些基本不变的部分放在前面把变化的部分放后面。反过来如果你每次都把不同的用户输入塞在最前面缓存基本命中不了。另外注意缓存的有效期——某些服务在调整 TTL 后实际命中率会明显下降省的钱就没那么多了。第三看清许可证再动手。想私有化部署、想封装成产品对外提供服务的一定先确认许可证MIT 类通常宽松但社区许可往往要求提供 MaaS 或编程助手类产品需另行申请商业许可。这一步踩坑后面很难补救。第四本地跑得动才是真便宜。一个 27B 左右的模型 4-bit 量化后大约 19GB能在 24GB 内存的机器上跑起来。对数据敏感、调用量稳定的场景本地部署省下的不只是 API 费还有合规风险。四、收个尾这波更新里最值得记住的不是某个模型的名字而是那条持续了几年的成本曲线能力在涨单位成本在掉。对开发者来说这既是机会也是负担——可选项多了选错的代价也分散在每一天的账单里。与其追榜单不如拿自己真实的几个任务跑一遍算算单位成本、看看稳定性、确认许可证。你现在项目里主力用的是哪个模型有没有因为输出 token 变多被账单反杀的经历评论区聊聊。
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。