尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

pxpipe 图像化渲染下的 Qwen 3.8 27B 质量评估:Spleen 5×8 不可读,JetBrains Mono 14px 才是可用的几何方案

发布时间:2026/9/28 2:35:18

资讯中心
01
ARTICLE

pxpipe 图像化渲染下的 Qwen 3.8 27B 质量评估:Spleen 5×8 不可读,JetBrains Mono 14px 才是可用的几何方案

pxpipe 图像化渲染下的 Qwen 3.8 27B 质量评估:Spleen 5×8 不可读,JetBrains Mono 14px 才是可用的几何方案
【免费下载链接】pxpipecut Claude Code token usage by rendering text context as images项目地址https://gitcode.com/gh_mirrors/px/pxpipe点击查看免费下载本文围绕 pxpipe 项目中eval/qwen-profile/QUALITY_RESULTS.md的质量评估报告完整梳理 Qwen 3.8 27Bworkers-ai/cf/qwen/qwen3.8-27b经 Cloudflare Workers AI 与本地网关接入在文本转图片渲染管线下的五项基准成绩并结合 eval/qwen-profile 目录下的评估脚本与结果收据、以及 src/core/gpt-model-profiles.ts 中内置的 Qwen 渲染画像解释为什么 5×8 位图字体对 Qwen 视觉编码器不可读、而 14px 等宽字体在 84 列几何下成为唯一可用方案。读完本文你将掌握这套质量评估的方法论、各基准的判定逻辑与复现命令以及如何通过模型画像与PXPIPE_GPT_PROFILES环境变量为 Qwen 系模型落地可用的渲染配置。一、评估背景为什么 Qwen 需要单独做质量评估pxpipe 的核心思路是把 Claude Code 会话中的大段文本上下文渲染成图片提交给模型从而压缩真实 token 消耗约 55% 的真实 token 缩减在 demo/cost-ab/README.md 中有验证。但图片里能看清多少字完全取决于目标模型的视觉编码器和**渲染几何字体、列宽、页高**的组合。同一个渲染配方在 Claude 上可用不代表在 Qwen 上可用。因此项目为每个模型家族维护独立的评估收据。本报告针对的是模型workers-ai/cf/qwen/qwen3.8-27b即qwen 3.827B 版本接入方式通过 Cloudflare Workers AI经本地网关OpenAI 兼容协议转发对比对象两种渲染几何——Spleen 5×8152 列项目默认的高密度 5×8 位图字形方案页宽 152 列、页高上限 1932px对应DEFAULT_GPT_STRIP_COLS 152与GPT_MAX_HEIGHT_PX 1932见 src/core/gpt-model-profiles.tsJetBrains Mono 14px84 列14px 等宽字体、84 列、页高上限 512px 的原生大字方案评估全部落盘为 JSON 收据receipts即novel-arithmetic-results.json、gist-recall-results.json、verbatim-hex-results.jsonSpleen 5×8 基线与verbatim-hex-14px-results.jsonJetBrains Mono 14px 试点均位于 eval/qwen-profile 目录。二、基准总览报告给出的核心汇总表如下注意两套几何并非在所有基准上都有数据GeometryArithmetic (N100)Gist (N98)State (N18)Never-Stated (N16)Dense Hex (N15)Paired Pilot (8 facts)Spleen 5×8 (152 cols)98/10072/9811/180/160/150/8 exact (unreadable / confabulated)JetBrains Mono 14px (84 cols)————11/158/8 exact (100%), 2/2 gist, 2/2 guard从这张表可以提炼出两个关键结论Spleen 5×8 在 Qwen 上可用但残废算术题语境含 factsheet 辅助能到 98/100但一旦要求逐字读取dense hex、paired pilot 精确事实抽取成绩直接归零甚至出现幻觉编造。JetBrains Mono 14px 是 Qwen 的唯一正确姿势在逐字读取类任务上达到 11/15 与 8/8 exact与不可读形成断崖式差距。三、Novel ArithmeticSpleen 5×8 下 98/1003.1 基准设计评估脚本 eval/qwen-profile/novel-arithmetic.mjs 通过线性同余生成器lcg默认种子SEED20260711生成 100 道不出现在训练语料中的全新应用题覆盖四类题型加法工厂三天的产量总和三个 4 位数相加加减混合水库注水/排水后的剩余水量乘加混合货架 × 每架箱数 散装箱数减法体育场售出后的剩余座位每道题跑三个臂arm做对照臂输入形态说明text纯文本题目对照基线不做图像化直接发给模型pure题目渲染为图片 文本指令纯视觉读取考验渲染图的可读性prod图片 factsheet精确数字清单 文本指令生产形态pxpipe 在渲染图旁附带 src/core/factsheet.ts 生成的精确数字备忘收据novel-arithmetic-results.json中的配方recipe记录了基线几何cols: 152, maxH: 1932, style.font: spleen-5x8最终成绩为textCorrect 100、pureCorrect 98、prodCorrect 98。值得注意pure与prod各错 2 题且错误不完全相同例如第 14 题pure/prod同为 3265 而text正确 3331第 20 题prod独错说明误差主要来自视觉读取环节而非算术本身。3.2 图片 token 计量脚本用visionTokensForModel(MODEL, im.width, im.height)来自 src/core/openai.ts逐图计算图像 token并随行落盘如imageTokens: 425。Qwen 走的是mpix按兆像素计费体制内置画像为1000 tokens/Megapixel这与收据中单题图片约 425 token 的量级一致84 列 × 512px 页面约 0.43 MP。3.3 复现命令# 环境准备网关必须可写 chat/completions export OPENAI_BASE_URLhttps://your-gateway.example.com # 必填 export OPENAI_API_KEY... # 网关要求鉴权时必填 export MODELworkers-ai/cf/qwen/qwen3.8-27b # 默认即此值 export LIVE1 # 关键开关置 1 才真正调模型并写收据 # 100 题、并发 5、超时 180s node eval/qwen-profile/novel-arithmetic.mjs常用可调参数N题数默认 100、SEED题目种子默认 20260711、CONCURRENCY并发默认 5、TIMEOUT_MS默认 180000。不带LIVE1运行时只会打印 dry-run 信息并退出不会产生收据。四、Gist Recall语义召回 72/98状态追踪 11/18从未出现信息 0 编造4.1 语料与判定脚本 eval/qwen-profile/gist-recall.mjs 复用 eval/gist-recall 下的合成终端会话语料按work10 会话/work26/work36三个 tier 共 22 个会话组织每个会话渲染为多张 PNGrenderTextToPngs来自 src/core/render.ts并附带 factsheet 文本。问题类型与判定逻辑correct()函数包括decision / 语义问题答案文本包含金标准即判对归一化小写后做子串匹配numeric用正则要求金标准数字以独立数字身份出现(?:^|\D)${g}(?:\D|$)防止7000被17000这类近似污染negation针对off/enabled开关类要求出现目标词且不出现反义词unanswerableguard上下文从未出现的信息只有回答UNKNOWN才算对收据gist-recall-results.jsonrecipe 同样为 152 列 Spleen 5×8给出的成绩可回答问题 72/98状态追踪work3 tier 子集11/18这类问题考验跨多轮会话的持续状态记忆是图像化上下文最难的场景之一Never-Stated guard16 个探针中 0 个被编造全部正确回UNKNOWN——这证明即使 Spleen 5×8 读取精度有限模型在该配方下也不会把未见信息当事实输出幻觉防线是完整的4.2 工程细节脚本支持断点续跑收据已存在的会话completedSessions会直接复用并打印(cached)避免重复计费prompt 强制要求答案一律以 JSON 字符串数组按题序返回找不到答案必须用 UNKNOWN输出经parse()从首个[到末个]截取 JSON 解析每次成功调用都会即时writeProgress()落盘中途中断不丢进度五、Paired PilotAlpha/Beta 双会话精确事实抽取为了模拟真实编码会话的信息密度报告还跑了一组成对合成终端试点Alpha 与 Beta 两个会话每个会话含 4 条精确事实抽取 1 条 gist 语义问题 1 条未陈述guard探针ProfileFixtureExact Facts (4)GistGuard (NOT STATED)NotesSpleen 5×8 (152 cols)Alpha0/4failfailRaw output empty; font unreadableSpleen 5×8 (152 cols)Beta0/4passpassConfabulatedpathandportJetBrains Mono 14px (84 cols)Alpha4/4passpassfingerprint、camelCase、path、portexactJetBrains Mono 14px (84 cols)Beta4/4passpass同上四项全部精确这一组数据完整回答了换成 14px 几何后质量损失在哪零损失。精确字段指纹、驼峰标识符、路径、端口号全部逐字符命中gist 与 guard 也全部通过而 Spleen 5×8 在 Beta 会话中虽然 gist/guard 意外通过但精确事实全部失败且出现了编造的path和port。对依赖从历史中精确回读配置值的场景如从 imaged history 重新读取确切数值Spleen 5×8 在 Qwen 上完全不可用。六、Verbatim Hex逐字读取的胜负手6.1 基线0/15verbatim-hex-results.json显示在 15 次试验中Spleen 5×8152 列下 Qwen 3.80/15 精确命中12 位十六进制 ID大量输出为空串输出非空的也全部是错误值如金标准c9c947f680ec得到2a19e563d3e4。报告明确指出原因5×8 位图字形对 Qwen 3.8 的视觉编码器过于密集too dense逐字符辨识失败。6.2 14px 试点11/15切换 JetBrains Mono 14px84 列、512px 页高后verbatim-hex-14px-results.json给出11/15 精确命中。报告同时引用同期其他模型的逐字读取成绩做参照Sol 7/8、Grok 4/8——注意这三个数字来自不同的评估套件、试验次数不同15 vs 8 vs 8仅作横向量级参考不宜直接按百分比换算对比。从verbatim-hex-14px-results.json的逐条记录可以分析 4 次失败的具体模式2 次调用中止ERR: This operation was aborted即超时中断属基础设施问题而非读取能力问题1 次空输出got: 2 次近邻字符替换8145b5a0fd46 → 81458a5b0fd6b5与8a混淆并发生一位移位、4a8164556b99 → 4a816455b6996b与b6换位。这类错误形态表明 14px 下 Qwen 已具备可靠的字形辨识力残余误差集中在形近字符b/8/6的局部混淆。评估脚本 eval/qwen-profile/verbatim-hex.mjs 从 eval/verbatim-15 的golds.json读取 15 个(page, dur_ms, gold_id)三元组读取对应page{n}.png要求模型找到 dur_ms 恰好为 X 的那一行只返回其 12 位小写十六进制 id输出经正则/[0-9a-f]{12}/i抽取后与金标准精确比对。脚本同样支持缓存续跑已完成的 trial 直接标记HIT/MISS跳过。14px 试点版本的收据记录font: jetbrains-mono-14, cols: 84, maxH: 512——这正是下文生产画像的几何来源。七、从评估到生产Qwen 内置模型画像这份评估直接决定了 src/core/gpt-model-profiles.ts 中 Qwen 3.8 27B 的内置画像BUILTIN_RULES中isQwenModel分支。画像逐项含义字段取值依据与含义vision{ regime: mpix, tokensPerMegapixel: 1000 }按兆像素计费每 MP 记 1000 tokencacheReadRate0.25缓存读入价 / 未缓存输入价 0.25outputRate3输出价 / 未缓存输入价 3providerImageCap32Workers AI 硬性限制单请求最多 32 张图超出会被服务端拒绝该上限使历史折叠预算变为动态min(配置的 history 上限, 32 − 请求中已有图片数)客户端自带图片与 pxpipe 自身图片共享同一额度stripCols84纵条宽度 84 列对应 14px 字体、保证 768px 无缩放宽度约束内maxHeightPx512单页最大高度 512px规避高页面的读取延迟悬崖style.fontjetbrains-mono-1414px 等宽字体——本次评估证明的唯一可用字体style.aatrue灰度抗锯齿图集style.gridfalse关闭网格辅助线historyNATIVE_14PX_HISTORY原生 14px 历史折叠策略来自 src/core/profile-base.tsfactSheetFormatfull渲染图旁附完整精确数字备忘两个重要的防误用机制家族守卫FAMILY_ID_GUARDSisQwenModel只匹配qwen3.8-27b正则/qwen3\.8-27b/i其他 Qwen 变体即使 id 中带qwen也会被isMisresolvedModelId()判定为命名了已知家族但无实测画像从而拒绝压缩而不是用错误公式计价——因为用 OpenAI 的 tile 公式给 Qwen 算视觉成本会产生错误的门控决策。见 src/core/gpt-model-profiles.ts 的FAMILY_ID_GUARDS与isMisresolvedModelId。环境变量覆盖PXPIPE_GPT_PROFILESJSON mapkey 为模型 id 前缀最长匹配优先可无改代码地微调任一旋钮例如export PXPIPE_GPT_PROFILES{qwen3.8-27b:{stripCols:100,maxHeightPx:768,style:{font:jetbrains-mono-14}}}注意覆盖时必须保持列宽 × 字体 ≥ 无缩放宽度的一致性否则服务端会静默降采样反而抹掉 14px 换来的可读性。八、完整复现流程按顺序执行即可复现本报告全部数字前提能访问 OpenAI 兼容网关且dist/已构建——评估脚本 import 自../../dist/core/*# 1) 构建 dist pnpm build # 或项目 README 中约定的构建命令 # 2) 网关环境 export OPENAI_BASE_URLhttps://your-gateway.example.com export OPENAI_API_KEY... export MODELworkers-ai/cf/qwen/qwen3.8-27b # 3) 三类基准各自 LIVE1 后真实调用并写收据 LIVE1 node eval/qwen-profile/novel-arithmetic.mjs # → novel-arithmetic-results.json LIVE1 node eval/qwen-profile/gist-recall.mjs # → gist-recall-results.json LIVE1 node eval/qwen-profile/verbatim-hex.mjs # → verbatim-hex-results.jsonSpleen 基线 # 4) 14px 试点切换画像后重跑 verbatim-hex.mjs生成 verbatim-hex-14px-results.json九、结论与可迁移经验从这份质量评估可以沉淀出三条可复用的结论渲染几何必须按模型实测不能跨模型复用Spleen 5×8 在 Claude/Gemini 家族见 eval/gemini-profile/QUALITY_RESULTS.mdGemini 3.6 Flash 在 312 列几何下逐字读取 14/15是可用的高密度方案但在 Qwen 3.8 上直接退化为不可读。密度与任务类型强相关Qwen 在 Spleen 5×8 下做语义推理算术 98/100尚可逐字读取hex 0/15则彻底失败14px 几何在两类任务上都稳。对需要从图像化历史中精确回读数值/标识符的部署必须下调密度。失败模式可诊断14px 残余错误主要是形近字符混淆b/8/6与超时中止而非结构性不可读——这为下一步调参如微调cellWBonus/cellHBonus、增加字间距指明了方向。Qwen 3.8 27B 的最终生产配方因此是JetBrains Mono 14px、84 列、512px 页高、按 MP 计 1000 token、单请求 32 图上限——这套配置已固化在gpt-model-profiles.ts内置画像中后续 Qwen 变体若想启用压缩需要先在自己的几何上跑完同样的评估套件再通过PXPIPE_GPT_PROFILES显式声明。赞分享【免费下载链接】pxpipecut Claude Code token usage by rendering text context as images项目地址https://gitcode.com/gh_mirrors/px/pxpipe点击查看免费下载相关推荐量化交易实战指南30天掌握可转债套利与基金分析完整方案量化交易实战指南30天掌握可转债套利与基金分析完整方案 还在为错过可转债套利机会而烦恼想要系统学习量化交易却不知从何入手GitHub热门项目sto/stoOpen-Source-Prompt-Library从PRD到MVP的完整开发清单Open Source Prompt Library从PRD到MVP的完整开发清单 想要快速将创意转化为可运行的产品Open Source Prompt Lyq 的 error 操作符短路表达式与数据校验实战指南yq 的 error 操作符短路表达式与数据校验实战指南 导读 在 yqportable command line YAML、JSON、XML、CSV、TO上一篇DeepSeek-V3.1-Terminus模型转换工具convert.py参数配置详解下一篇开发自定义MCP工具扩展claude-code-ide.el功能的完整指南创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。