尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

如何在自己的显卡上运行 MemPalace 小模型评测框架,用 Ollama 本地模型验证准确率与 VRAM 表现?

发布时间:2026/9/13 11:43:28

资讯中心
01
ARTICLE

如何在自己的显卡上运行 MemPalace 小模型评测框架,用 Ollama 本地模型验证准确率与 VRAM 表现?

如何在自己的显卡上运行 MemPalace 小模型评测框架,用 Ollama 本地模型验证准确率与 VRAM 表现?
如何在自己的显卡上运行 MemPalace 小模型评测框架用 Ollama 本地模型验证准确率与 VRAM 表现【免费下载链接】mempalaceThe best-benchmarked open-source AI memory system. And its free.项目地址: https://gitcode.com/GitHub_Trending/me/mempalace如果你想在本地 NVIDIA 显卡上用 Ollama 跑的 ≤4B 参数小模型验证 MemPalace 的分类与抽取任务表现仓库内置的benchmarks/model_eval评测框架可以直接复用它会对每个(模型, 任务, 模式)组合输出准确率、延迟TTFT、TPS、e2e p50/p95以及 VRAM 占用并把结果写成 CSV再渲染成 Markdown 报告。前提条件是一块 NVIDIA 显卡Tier 1 候选集最低约 10 GB VRAMFP16 变体约 14 GB、已安装 Ollama0.23.2 为已测版本、Python 3.10 和uv。发布基准所用的机器是 RTX 309024 GB完整本地矩阵约 60 分钟跑完。准备环境克隆仓库并同步依赖按 评测框架 README 的说明在目标机器上执行git clone https://gitcode.com/GitHub_Trending/me/mempalace.git cd mempalace uv syncuv sync会按 pyproject.toml 创建虚拟环境并安装项目依赖评测框架运行在uv run提供的环境里。完整机器要求来自 README 的 Prerequisites 一节GPUNVIDIA 卡Tier 1 集合最低约 10 GB VRAMFP16 变体约 14 GBOllama0.23.2 已测试更新版本应当可用更旧版本可能破坏think参数或/api/ps端点的返回结构框架对后者有回退处理Python3.10项目用uv管理环境磁盘完整本地候选集约 30 GB 空闲仅 Tier 1 约 24 GBOllama Cloud 账号可选只在需要复跑云端对照时用到跑之前先ollama signin拉取候选模型候选模型清单在 candidates.yaml 中按tier字段分组tier1是必评集合tier2是更小尺寸面向 VRAM 受限场景tier3是 FP16 上限对照另有modern和cloud分组。orchestrator 的 tier 过滤只会运行本地已安装的模型。拉取 Tier 1 全量集合约 24 GB含 embedding 模型时README 提供了这段脚本它会读取candidates.yaml并逐个执行ollama pull# This script reads candidates.yaml and pulls every tier-1 model the embedding model uv run python -c import yaml import subprocess with open(benchmarks/model_eval/candidates.yaml) as f: cands yaml.safe_load(f)[candidates] for c in cands: if c.get(tier) 1: print(fpulling {c[\tag\]}) subprocess.run([ollama, pull, c[tag]], checkTrue) subprocess.run([ollama, pull, nomic-embed-text], checkTrue) 副作用说明ollama pull会从 Ollama 注册表联网下载模型文件到本地消耗上面列出的磁盘空间脚本只执行拉取不会改动仓库文件。如果只想评 Tier 2sub-3B或modern分组Gemma 4、Granite 4.1、Ministral 3、Qwen 3.5把过滤条件改成c.get(tier) in (1, 2)、c.get(tier) modern即可。云端对照是可选分支需要ollama signin后才执行 README 给出的云模型拉取循环。冒烟测试一个模型一个任务先跑通在投入完整矩阵之前用runner对单个(model, task, mode)组合做冒烟测试README 标注整个过程 30 秒以内uv run python -m benchmarks.model_eval.runner \ --model qwen3:4b-instruct-2507-q4_K_M \ --task calibration \ --mode default \ --dataset-dir benchmarks/model_eval/datasets文档给出的预期结果终端应出现约 20 次推理并打印一个 JSON 结果其中accuracy约等于0.95或接近。calibration是 20 条样本的句类五分类任务数据集说明 明确写道任何正常工作的模型在这里都应达到 ≥95% 准确率如果模型连 calibration 都过不了说明它已损坏或配置错误不应再跑更有意义的任务。如果准确率明显偏低按 README 的排查顺序检查ollama list中该模型是否在本地已加载nomic-embed-text是否已拉取任何 open-set 或 memory 任务都需要 embedding 模型calibration 本身不用。注意 runner.py 中--embed-model的默认值实际上是embeddinggemma且框架会在模型缺失时自动ollama pull补齐见_ensure_embed_model而 README 的批量拉取脚本拉的是nomic-embed-text。两处文档指向的默认 embedding 模型不一致最稳妥的做法是两者都拉取或运行矩阵时用--embed-model显式指定避免 Embedding model unavailable 错误行。运行评测矩阵冒烟测试通过后用orchestrator跑矩阵。Tier 1 只评README 估算 RTX 3090 上 30–40 分钟uv run python -m benchmarks.model_eval.orchestrator \ --candidates tier1 \ --tasks all \ --dataset-dir benchmarks/model_eval/datasets \ --output benchmarks/model_eval/results/$(date -u %Y-%m-%d)-$(hostname).csv要覆盖全部本地候选约 60–80 分钟把--candidates tier1换成--candidates local。命令中的$(date -u %Y-%m-%d)和$(hostname)是 shell 变量展开运行时会生成形如2026-09-12-yourhost.csv的日期主机名文件名不需要手工替换。--candidates的可选过滤值来自 orchestrator.pytier1、tier2、tier3、tierN、local所有非 cloud 项、cloud、modern或任意精确模型 tag只跑单模型也支持逗号分隔的多个 tag。--tasks all展开为 room_classification 的 closed 与 open 两种模式、entity_extraction、memory_extraction、calibration 共五个(task, mode)组合。运行行为上有两点值得提前知道orchestrator 每完成一项打印[i/N]进度和acc… e2e_p50…ms vram…CSV 逐行增量写入——只要部分数据也可以直接 Ctrl-C 停止每个模型的第一次调用会被丢弃缓存与 GPU 升频的影响计时基于 Ollama 响应里的prompt_eval_duration、eval_duration、eval_count等字段提取每个候选默认以--num-ctx 4096运行保证所有模型在同一上下文窗口下可比。框架对每个组合采集的指标见 metrics.py指标来源accuracy任务各自的打分逻辑对标注数据集计算TTFT p50/p95Ollama 的prompt_eval_duration load_duration近似TPS p50/p95Ollama 的eval_count / eval_duratione2e 延迟 p50/p95Python 侧 wall-clock 全请求耗时VRAM resident模型 warmup 后从 Ollama/api/ps读取VRAM peak推理期间每 500ms 轮询一次nvidia-smi渲染报告矩阵跑完后用summarize把 CSV 渲染成 Markdown 报告uv run python -m benchmarks.model_eval.summarize \ --csv benchmarks/model_eval/results/$(date -u %Y-%m-%d)-$(hostname).csv \ --output benchmarks/model_eval/reports/$(date -u %Y-%m-%d)-$(hostname).mdsummarize.py 生成的报告包含每任务的准确率与速度排名、VRAM 消耗表Resident/Peak/Delta 三列、生产选型建议所有任务主指标 ≥0.8 且 e2e p50 ≤500ms 的模型、open-set 可用性判断平均余弦相似度 ≥0.7 才认为可用以及 instruct 与 reasoning 变体的对比。如果某些(model, task)出错报告末尾会有 Errors 表列出失败项。核对结果与发布基线对比怎么读仓库提交了基线 CSV 在 results 目录如2026-05-10-z690-ex-glacial.csv为 RTX 3090 全本地矩阵另有 cloud、modern、spot-check 文件README 给出的比对规则准确率你的数字应落在基线 ±1% 以内。偏差更大意味着环境有差异——Ollama 版本不同、模型 digest 不同、系统提示词渲染不同速度绝对毫秒数不可跨机器移植取决于 GPU、驱动、温度状态、并发负载只在你自己的机器上用相对排名作为可比信号VRAM resident同一 Ollama 版本下应接近VRAM peak 噪声更大取决于测量时 GPU 上的其他活动。另外两条来自代码的边界peak 轮询只跟踪 GPU 0单卡是本评测的假定部署形态每份结果文件都附带测试机元数据CPU、GPU、VRAM 总量、Ollama 版本、OS、主机名方便事后追溯。已知限制与下一步框架对所有调用强制thinkFalse混合推理模型始终以快速分类模式跑纯推理变体按政策被排除在候选集之外数据集是 2026-05-10 生成并冻结的合成数据无真实个人信息跨 run 可比如需扩展只能追加样本不要替换已有样本否则历史数字失去可比性Ollama Cloud 不支持强制 structured outputsformat: json在云端请求上会被静默忽略——这是 分析报告 记录的现象本地运行不受影响。如果你的准确率与发布基线出现有意义的偏差README 给出的路径是先对出问题的模型单独跑一次冒烟测试并保存 JSON 输出然后带着ollama --version、GPU 型号、CSV 文件和冒烟 JSON 到本仓库提 issue。想加入新的 ≤4B 候选模型时按 candidates.yaml 的 schema 补一行再用--candidates 你的tag跑冒烟和矩阵附上 CSV 结果提交即可——数据集和打分代码原样复用准确率数字在不同候选之间保持可比。【免费下载链接】mempalaceThe best-benchmarked open-source AI memory system. And its free.项目地址: https://gitcode.com/GitHub_Trending/me/mempalace创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。