尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

Jev专题:Agent记忆控制能不用LLM吗?Jev-Mem建库提速6.6倍

发布时间:2026/9/24 19:09:01

资讯中心
01
ARTICLE

Jev专题:Agent记忆控制能不用LLM吗?Jev-Mem建库提速6.6倍

Jev专题:Agent记忆控制能不用LLM吗?Jev-Mem建库提速6.6倍
1《三年面试五年模拟》AIGC / LLM / AI Agent 算法工程师与开发工程师求职面试秘籍独家资源见 WeThinkIn/AIGC-Interview-Book欢迎 Star2AIGC / LLM / AI Agent 算法岗与开发岗求职面试内推学习社群涵盖 AIGC、LLM 大模型、AI Agent、传统深度学习、自动驾驶、机器学习、计算机视觉、自然语言处理、强化学习、大数据挖掘、具身智能、元宇宙、AGI 等方向的最新面试干货与核心知识欢迎加入(https://t.zsxq.com/DZRng)论文标题Jev-Mem: System-One-Controlled Agentic Memory for Efficient AI Agents论文作者The University of Texas at Dallas计算机系第一作者Dongming Jiang通讯作者Bingzhe Li发表时间2026年9月21日目录一、Jev是什么System One模型怎么用二、Agent记忆为什么把LLM放在关键路径上三、三平面架构与System One控制的写路径四、自适应检索、预算分配与证据驱动停止五、LoCoMo上的准确率与效率对比六、短板与论文没回答的问题七、Jev-Mem运行与Jev API调用实践八、总结与思考本文要点1Jev-Mem是UT Dallas在2026年9月挂出的Agent记忆架构把记忆分类、建边、查询路由、候选打分和停止判断交给TypeSafe AI的System One模型JevLLM只负责最后合成答案。2LoCoMo上LLM-as-a-Judge总分0.777比最强基线MAGMA的0.700高11.0%五类问题里四类第一对抗类0.962。3记忆构建158秒比最快对手Nemori的1044秒快6.6倍平均查询延迟0.93秒比MAGMA的1.47秒低36.7%。4短板是控制器依赖商业闭源API且只吃文本论文只测了一个基准没有消融正文数字和表格有几处对不上Jev文档自己承认日期比较和长state会失准。5文末附仓库的离线demo、建库查询、LoCoMo复现命令以及Jev官方的Noul、Choice、Score调用示例。2026年9月21日UT Dallas的Dongming Jiang、Yi Li和Bingzhe Li把Jev-Mem挂上arXiv。我把论文HTML版、附录B里的完整提示模板、GitHub仓库README和TypeSafe AI的官方文档对了一遍数字以论文表1和表2为准。这篇论文问的问题很具体。一个长期运行的Agent每写进一条记忆都要判断它是什么类型、和哪些旧记忆有关系每来一个问题都要判断去哪个图上找、找到的东西够不够、要不要继续。这些判断以前要么写死规则要么反复调一次大模型。作者想知道把它们全部交给一个不生成文本、只回概率的小模型准确率会掉多少。答案是没掉反而涨了。LoCoMo上总分0.777比同一组作者自己此前的MAGMA高0.077记忆构建从1404秒压到158秒。下面按写路径、读路径、结果、短板的顺序拆。一、Jev是什么System One模型怎么用Jev是TypeSafe AI于2026年9月15日发布的模型公司创始人是前OpenAI研究员Diogo Almeida种子轮4000万美元由DCVC领投。它的输入是一段state文本或JSON都行外加若干事先声明好类型的问题一次前向并行返回每个问题的答案和概率分布不输出任何自然语言。问题有三种类型。Noul是一个是非命题返回P(yes)。Choice是多选一最多255个选项返回选中项、每个选项的概率和一个confidence。Score是有序打分2到10档返回分值和分布。官方文档反复强调一件事每个问题只问一件几秒钟能判断的事复杂判断拆成多个问题后在代码里合并。价格按输入算每百万token收0.042美元输出免费。上下文64k其中state加最长单题不超过32k。只支持文本。训练方法叫RLCD官方只给了名字和校准决策这个目标没有论文、奖励函数和架构细节Almeida在播客里也承认还没公开。官方自测四类工作流平均67.8%前沿模型68%到74%速度和成本优势最高分别193.6倍和444.6倍但测试集是官方自己造的。Jev发布六天后就有了这篇论文它是我看到的第一篇把这个模型当成系统组件来用的工作。它没有拿Jev去替代LLM回答问题只拿它做记忆管理里那些输出空间很小的判断。二、Agent记忆为什么把LLM放在关键路径上论文第2节把Agent记忆写成三个函数。检索ER(q,M)推理oL(q,E)更新M’U(M,q,o)。早期系统的R就是向量相似度top-kU就是往库里追加。近两年的系统开始在U里做分类、去重、建图在R里做路由、多跳、重排。作者的观察是U和R里新增的判断大部分是语义的但输出是有界的。判断一条记忆是不是事件输出一个概率。判断两条记忆有没有因果输出一个概率。判断当前问题需不需要时间关系还是一个概率。用自回归大模型来做这些事每一次都要生成一段文字、格式化、再解析回结构。这些调用挤在记忆的关键路径上构建期成千上万次检索期每一轮都有。表2把这个开销量出来了。A-MEM在LoCoMo上建一次记忆要3636秒MemoryOS要3276秒MemoryOS的单次查询延迟32.68秒。它们慢在每一步都在等大模型吐字。论文把这种分工叫System One和System Two。前者做快而多的结构化判断后者做慢而少的开放式推理。这个词借自双过程认知理论作者在附录A.1里说明只是计算分配上的类比不主张机制对应。三、三平面架构与System One控制的写路径Jev-Mem分三层。System One控制平面由Jev承担记忆数据平面是一组共享节点加四种关系边System Two推理平面是普通LLM实验里是gpt-4o-mini。四种关系是语义、时间、因果、实体全部挂在同一批节点上一对节点可以同时有几种边。另外还有一份共享的向量索引和关键词索引。写路径分四步观测进来先分类再找候选再判关系最后入库。分类是四个独立的Noulepisodic、semantic、procedural、preference各给一个0到1的分数一条观测可以既是事件又是语义事实。附录B.2给了完整的提示模板比如episodic问的是这条观测是否描述了某个参与者的具体经历或事件true和false各配一句判据。默认配置关掉了准入过滤所有非空观测都入库。作者的理由是写入时的丢弃不可逆一条当时看着没用的记忆可能在几十轮之后被问到选择性放到建边和检索两个阶段去做。建边先由确定性检索找候选。向量相似、词法重叠、共享实体、时间邻近四个信号合起来取top-10Jev只对这10对做判断控制器成本不随记忆总量线性增长。每一对问语义关联、正向因果、反向因果三个Noul实体名字没有精确匹配时再加一个别名问题。概率过0.60就建边因果边带方向。有现成结构信息的地方不问Jev。两条记忆都有时间戳直接按先后建时间边。实体标识精确相同直接建实体边。只有时间顺序隐含在文字里的时候才用一个Choice在before、after、during、contains、overlaps、same_time、unknown七个选项里挑。每成功写入20条跑一次周期性整理。Jev对邻域里的候选对回答冗余、矛盾、过时、值得加链四个Noul再用一个Choice在keep_separate、merge、promote、uncertain四个表示里选。原始观测始终保留。只有选中merge或promote的概率不低于0.85、且矛盾分低于0.85时才允许调用System Two生成一条新的摘要节点。在这套系统里生成只在一次控制决策通过之后才发生。四、自适应检索、预算分配与证据驱动停止读路径是一个控制回路。路由取锚点评估证据扩展重新评估直到停止条件满足。路由请求只送查询本身问六个Noul分别是这个问题需不需要语义、时间、因果、实体四类关系需不需要多跳近期性重要不重要。六个概率独立一个问题可以同时激活几个图。默认配置的图扩展总预算是80需求分不低于0.10的图至少分到1剩下的按需求分比例分配最大余数法取整指数γ设为1.0。多跳分决定允许的遍历深度公式(15)里深度上限乘以多跳概率再向上取整。锚点靠向量检索和BM25式关键词检索各出一份排名用倒数排名融合合成κ取60默认取30个锚点作为起始前沿。之后每一轮Jev先看当前证据集回答四个Noul。证据是否足够再检索一轮有没有用是否缺必需证据是否有未解决的矛盾。附录B.5给的阈值是证据足够分不低于0.95且缺失分和矛盾分都低于0.15则停止。或者继续有用分低于0.15也停止。这两个条件之外还有一组硬上限深度8访问节点60检查边2400Jev调用16次检索时间15秒。不停的话就沿激活的图扩展邻居每个新候选让Jev回答四个Noul和问题相关吗这条边有用吗有没有新信息支持现有证据吗。四个分数与向量相似度、所在图的需求分、边上存的概率按公式(23)加权有时间戳时再按近期性分做一次修正。取分数最高的10个进下一轮波束并加入累积证据。停止之后最高分的若干条记忆交给System Two出答案默认答案top-k是40多跳问题50。控制开销是有界的。一次写入最多一次分类请求加一次关系请求一次查询是一次路由请求加每轮最多一次证据评估和一次候选打分。Jev一次请求里可以塞多个问题并行评估所以这里的一次确实是一次网络往返。论文里有一句话我认为比阈值更重要。附录B.1写明Jev返回的数值不被假定为校准概率。也就是说0.60、0.85、0.95这些门限是在这个数据集上调出来的经验值换一个领域要重新调。五、LoCoMo上的准确率与效率对比LoCoMo是Maharana等人2024年提出的超长多会话对话基准问题分单跳、多跳、时间、开放域、对抗五类。对抗类里放的是看着相关却会误导的内容考的是系统能不能不被带偏。所有系统的答案模型统一为gpt-4o-mini评分用LLM-as-a-Judge。先把论文表1和表2合在一起。方法多跳时间开放域单跳对抗总分建库时间(秒)查询延迟(秒)Full Context0.4680.5620.4860.6300.2050.481不适用1.74A-MEM0.4950.4740.3850.6530.6160.58036362.26MemoryOS0.5520.4220.5040.6740.4280.553327632.68Nemori0.5690.6490.4850.7640.3250.59010442.59MAGMA0.5280.6500.5170.7760.7420.70014041.47Jev-Mem0.6230.6370.6180.8020.9620.7771580.93总分0.777比MAGMA的0.700高0.077相对提升11.0%。拉开差距最大的是对抗类0.962对0.742。这一类要的是检索完之后敢判断证据不够Jev-Mem的停止请求里恰好有证据是否足够和是否缺必需证据两个问题答案模型拿到的证据集更干净就更容易说没有。开放域0.618对0.517多跳0.623对0.569论文把这两项的提升也归到检索质量上。时间类是唯一没赢的。表1里Jev-Mem是0.637MAGMA是0.650Nemori是0.649。正文4.2节却写Jev-Mem追平了最佳时间分0.650并把多跳写成0.625、开放域0.610、单跳0.797四个数字都和表1不一致。仓库README用的是表1的数并明说MAGMA时间分最高。我按表1写但这几处对不上说明定稿时改过数没有全改。效率上的差距更大。建库158秒最快的对手Nemori是1044秒快6.6倍论文换算成减少84.9%。相对MAGMA的1404秒按同样口径算快8.9倍。查询延迟0.93秒比MAGMA的1.47秒低36.7%比直接把全部对话塞进上下文的1.74秒低46.6%。延迟含检索和答案生成两段答案生成那段两边用同一个模型省下的主要在检索。最有说服力的对照是MAGMA到Jev-Mem这一步。两者出自同一组作者用同样的四关系图仓库README写明省掉所有Jev参数就能跑出MAGMA基线。记忆结构没变把控制判断从LLM换成Jev准确率涨了0.077建库快了近9倍查询快了三分之一。这是论文里最干净的一组数。六、短板与论文没回答的问题控制器是一个商业闭源API。Jev目前只有TypeSafe AI一家在提供模型jev-1.13.0训练方法RLCD没有公开细节权重不开放。Jev-Mem仓库是MIT协议但没有API key就只能跑mock模式仓库自己也写明mock只替代Jev答案生成和评分仍要调在线模型。把记忆层的每一次判断绑在一家初创公司的接口上对生产系统是实打实的依赖风险。Jev只吃文本。多模态Agent的记忆里有截图、音频、传感器数据得先转成文字才能进state。论文没讨论这一点。Jev的官方文档专门列了一页jev-1.13的失效模式其中几条直接打在Jev-Mem的要害上。日期和时间比较不可靠模型把日期当文本读前后顺序、间隔长短都容易错这和时间类是唯一没赢的项目对得上。state里无关内容多时准确率下降而Jev-Mem的候选打分请求里同时装着查询、已选证据和一批候选。对抗性文本能把答案带偏一条恶意写入的记忆理论上可以操纵后续的建边和路由。官方还写明英语是主训练语言中日韩文本可用但效果没那么好中文场景要自己先测。System One判错了会怎样。写路径上关系判断漏了一条因果边检索时这条路就断了只能靠向量和关键词锚点兜底。读路径上停止判断过早给出证据足够答案模型就在残缺证据上作答论文没有报告这类错误的比例。相关性打分偏高则把噪音送进证据集。对抗类的好成绩说明这在LoCoMo上没大问题换数据集不一定。评测本身有几处薄弱。4.1节开头写在两个广泛使用的基准上评测正文只有LoCoMo仓库里有LongMemEval的运行脚本但README明说不主张任何结果。没有消融实验仓库提供了--no-jev-write和--no-jev-read两个开关论文没用它们给出数字读者无法知道写路径和读路径各贡献了多少。没有方差没有多次运行。也没有报告一次完整建库调了多少次Jev、花了多少钱以及gpt-4o-mini那部分的token消耗对比。最后一点是阈值。0.60建边、0.85才允许合并、0.95才算证据足够、预算80、波束10这些全是配置文件里的常数论文没说是怎么定的也没有敏感性分析。附录B.1明说Jev返回值不被视作校准概率那么这些门限在另一个领域上大概率要重调。七、Jev-Mem运行与Jev API调用实践仓库要求Python 3.11以上MIT协议。以下命令出自仓库README。先跑离线demo不需要任何API key和模型下载它用确定性的mock决策和mock向量演示整条流水线并打印决策轨迹不衡量答案质量。python3.11-mvenv .venvsource.venv/bin/activate python-mpipinstall-rrequirements.txt python-mjev_mem.demo接真实模型要在仓库根目录建一个.env放两个key。Jev负责记忆决策OpenAI兼容接口负责出答案和评分。默认配置用jev-latest答案模型用--model指定默认embedding后端是minilm第一次运行会下载。TYPESAFE_API_KEYyour-typesafe-key OPENAI_API_KEYyour-openai-key用仓库自带的合成观测建库并查询。python-mjev_mem--modebuild--inputexamples/observations.json\--jev-config config/jev_mem.json --cache-dir ./jev_mem_cache/app python-mjev_mem--modequery--questionWhat reminder does Mira prefer?\--jev-config config/jev_mem.json --cache-dir ./jev_mem_cache/app自己的数据给一个JSON列表元素是字符串或者带content、可选ISO 8601格式timestamp、可选metadata的对象。复现LoCoMo要先按data/README.md从原始发布方下载数据集放到data/locomo10.json然后跑样本0的前10个问题。python-mjev_mem.benchmarks.locomo\--datasetdata/locomo10.json\--jev-config config/jev_mem.json\--sample0--modelgpt-4o-mini\--max-questions10--category-to-test1,2,3,4 --best-of-n1几个参数要看一眼。--best-of-n 1是README特意提醒的继承来的默认值3会用参考答案参与挑选把准确率往上带。--category-to-test 1,2,3,4排除了对抗类5README说这一类需要单独分析。--jev-mock只替代Jev答案和评分照样调在线模型。去掉全部Jev参数就是MAGMA基线加--no-jev-write或--no-jev-read分别关掉写控制和读控制加--reuse-memory可以复用已建好的图只调检索。config/jev_mem.json里的关键常数和论文附录B对得上列在下面。配置项默认值作用admission_enabledfalse保留所有有效观测candidate_top_k10每次写入的关系候选上限relation_threshold0.60推断关系的建边门限anchor_count30混合检索的锚点数answer_top_k / multihop_top_k40 / 50送给答案模型的证据上限total_graph_budget80图扩展总预算maximum_nodes / maximum_edges60 / 2400遍历上限maximum_jev_calls16单次检索的Jev调用上限Jev本身的调用方式来自TypeSafe官方文档。Python SDK装typesafe-sdk要求Python 3.10以上客户端从环境变量读TYPESAFE_API_KEY默认模型jev-latest目前指向jev-1.13.0。下面这段把三种原语放在一次请求里。fromtypesafe_sdkimportChoice,Noul,Score,TypeSafeClient clientTypeSafeClient()ticketHi, Ive been trying to connect my Stripe account for 3 days and the integration keeps failing. Im losing sales. Please help ASAP.responseclient.system_one(stateticket,questions{department:Choice(instructionsWhich team should handle this,criteria{billing:Payment or subscription issues,technical:Bugs or integration problems,sales:Pricing or account questions,},),frustration:Score(instructionsHow frustrated the customer appears,criteria[Calm, just stating facts,Frustrated but civil,Very angry, strong language,],),is_urgent:Noul(instructionsThe message conveys urgency or time-sensitivity,),},)print(response.answers[department].choice)# technicalprint(response.answers[frustration].score)# 1.0print(response.answers[is_urgent].noul)# 1.0state是被判断的对象字符串或JSON都行。questions是一个字典键是你自己起的ID官方文档提醒ID不会送进模型所以问题要在instructions里写完整。Choice的criteria是选项到说明的映射Score的criteria是从低到高的有序档位列表Noul的criteria可选用来说明true和false各指什么。返回里Choice带choice、probabilities、confidenceScore带score、legend、probabilities、confidenceNoul只有一个noul值。直接走HTTP也可以端点是POST https://api.typesafe.ai/v1/systemone请求体里model填jev-latest。curl-XPOST https://api.typesafe.ai/v1/systemone\-HAuthorization: Bearer$TYPESAFE_API_KEY\-HContent-Type: application/json\-d-EOF { state: Hi, Ive been trying to connect my Stripe account for 3 days and the integration keeps failing. Im losing sales. Please help ASAP., model: jev-latest, questions: { urgency: { type: noul, instructions: Does this message express urgency? } } } EOFstate是JSON对象时官方建议在instructions里用反引号包住路径指向具体字段例如Doesticket.messages[0].textrequest a refund?。Jev-Mem附录B里的提示全是这么写的new_memory.content、candidates[0].content、evidence都是state里的字段名。同一请求里的问题互相看不见彼此的答案需要依赖前一个答案时要发第二次请求。八、总结与思考Jev-Mem证明了一件事。Agent记忆里那些高频、有界的判断交给一个只回概率的小模型来做在LoCoMo上准确率没有掉建库时间从上千秒压到158秒。这个结论不依赖Jev这一家任何能快速回答是不是哪一个的模型都能接进这个架构论文自己写的核心贡献也是这种架构分离Jev只是一个具体实现。从MAGMA到Jev-Mem的那组数最值得记住。同样的图换掉控制器总分0.700到0.777建库1404秒到158秒。记忆系统的慢在每一步等大模型生成这件事上四关系图本身不贵。要在自己的系统里用我会先盯三个地方。一是Jev是闭源API没有本地替代方案要接受这个依赖或者自己训一个同接口的小分类器。二是阈值全是常数且论文承认返回值不是校准概率换领域必须重调。三是中文场景要先测官方文档写了英语是主训练语言。论文最该补的是消融和第二个基准。仓库里两个开关都有LongMemEval的脚本也有跑出来就能回答写路径和读路径各值多少。正文和表格四个数字对不上也该修一版。在这些补齐之前我把它看作一个方向验证充分、工程细节可信、但泛化性还没被检验的工作。参考链接论文原文 arXiv 2609.23986 v12026年9月代码仓库 libingzheren/Jev-MemMIT协议Jev官方博客 Introducing System One Models and JevJev官方文档 docs.typesafe.ai含jev-1.13失效模式与模型与价格LoCoMo基准 Evaluating Very Long-Term Conversational Memory of LLM Agents2024年2月对比方案 MAGMA、A-MEM、Nemori、MemoryOS
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。