GitHub 趋势深观察,agent 经济开市后,记账和质检两个岗位上岗了

发布于 · 1,718 字 · 约 4 分钟#Github 解读#Agent 基建
GitHub 趋势深观察,agent 经济开市后,记账和质检两个岗位上岗了 封面图
  • 8/18 榜单里 ai-memory 和 LLM-as-a-Verifier 两个信号此前无人深拆,一个管 agent 的长期记忆,一个管 agent 的产出验收。
  • ai-memory 是 Rust 单二进制,wiki 目录用 git 版本化的 markdown 当唯一真源,SQLite FTS5 加实体图做检索,不依赖向量库。
  • 它通过生命周期钩子在会话结束时把观察固化成 wiki 页,下次 SessionStart 注入 where you left off,支持 Claude Code、Codex、Cursor 等 20 多个 CLI 互接。
  • LLM-as-a-Verifier 免训练,用 score token 的 logprob 分布期望做细粒度奖励,概率枢轴锦标赛把 N 选一的成本从 O(N²) 压到 O(Nk)。
  • Terminal-Bench 从 83.1 提到 86.5 接近 oracle 的 92.1,自验证场景 best-of-5 从 78.7 拉到 88.0。

开篇,经济开市了,账本和质检在哪

今天凌晨那篇趋势文把 8 月 18 号的榜单读成 Agent 经济开市日,审计员、法院、协作办公室同日上岗。那个叙事成立,但它把榜单里另外两个安静的信号略过了。

一个管记,一个管验。

ai-memory 排第 10,+730 星,Fábio Akita 用 Rust 写的 agent 长期记忆。LLM-as-a-Verifier 排第 7,+892 星,一个免训练的 agent 轨迹验证框架。

你想想看,一个经济体系光有交易场所和司法系统是不够的。昨天干了什么今天不记得,每次从头解释一遍架构,这是记的问题。活干完了没人验,best-of-N 全靠抽签,这是验的问题。这两个岗位补上,agent 才谈得上真的在做事,而不是表演做事。

今晚这篇就把这两个信号拆开讲透。

ai-memory,把记忆做成 git 仓库的人

ai-memory 解决的场景你一定熟。Claude Code 里聊到一半退出了,转头打开 Codex,之前的架构决策、失败的尝试、悬而未决的问题全部清零,重新解释一遍。

它的做法是给编码 CLI 挂一个 Rust 单二进制的 MCP 和 HTTP 服务,默认只监听 127.0.0.1:49374。数据目录分四块,wiki 目录是真源,git 版本化的纯 markdown,raw 目录存脱敏的会话片段,db 目录是 SQLite,外加模型和日志。

机制上最巧的是生命周期钩子。agent 跑的时候,钩子静默捕获 prompt、工具调用、压缩事件、会话边界,POST 给服务。会话结束时,这些观察被 LLM 整理成一篇 wiki 页固化下来,同时生成一份有长度上限的 where you left off,在下一次 SessionStart 时注入。中断即存档,续聊即恢复。

检索这一层它没有上向量数据库这种重武器。

FTS5 全文检索打底,实体匹配走 RRF 融合,每页 frontmatter 里最多放 10 个名词,再叠图邻居的 RRF,向量检索只是可选项。权限感知的排序会让规则、决策、流程类的页面排前面。markdown 直接 grep 得动,Obsidian 能直接打开,这套「无聊技术」组合拳反而比向量库透明得多。

生态覆盖是这个项目最狠的部分。Claude Code、Codex、Cursor、Gemini CLI、OpenCode、Kimi Code、Kiro、Grok Build 等 20 多个 CLI 全支持,跨 agent handoff,按项目 UUID 隔离,还有 zero-LLM 模式,完全不调模型也能用规则摘要跑起来。1,254 个 commit,Akita 是把它当长期项目在养。

LLM-as-a-Verifier,给 agent 轨迹打分的免训练框架

LLM-as-a-Verifier 的出发点很朴素,agent 干活的过程本身需要细粒度的评价,而不是最后给一个过或不过。

它免训练,pip install 就能用,靠两个技术撑起来。

第一个是细粒度奖励估计。不是让验证模型吐一个离散分数完事,而是对 score token 的整个 logprob 分布求期望,多个评价维度、多次重复评估取平均。分数的概率分布全用上,比单点判断稳得多。

第二个是 Probabilistic Pivot Tournament,概率枢轴锦标赛。N 个候选要选最好,全配对两两比是 O(N²),它用环形轮转加枢轴机制压到 O(Nk)。环形设计里 A/B 槽位交替,专门用来消除大模型的位置偏差,同一个对比问两次,正着问反着问。

数字说话。验证器用 Gemini 2.5 Flash 的时候,Terminal-Bench V2 的 Pass@1 从 83.1 提到 86.5,而人类标注的 oracle 是 92.1,验证器吃掉了一大半差距。SWE-Bench Verified 从 76.1 到 78.2,MedAgentBench 从 70.2 到 73.3。自验证场景更夸张,deepseek-v4-flash 给自己的 rollout 打分,best-of-5 从 78.7 直接拉到 88.0。

v0.2.0 加的 prefix-cache 优化让这件事在工程上可用,未命中 token 减少约 3.4 倍,缓存命中率 78.8%。它还带了个 Claude Code 插件 TurboAgent,当 API 代理做 best-of-N 选择,即插即用。论文挂在 arxiv 2607.05391。

两个信号拼出来的判断

验证是 agent 自主性的真正瓶颈

dsh 那类 harness 把 agent 的手放开了一天,24 小时无人值守不是科幻了。但放手的前提是有人兜底验收,否则自主性越强,返工越贵。verifier 框架把 best-of-N 从抽签变成有依据的筛选,86.5 对 92.1 那个差距,就是纯自动验证离人工质检还剩的距离。

记忆标准化比模型标准化来得更早

20 多个 CLI 都能接 ai-memory 这件事比它本身的功能更重要。当记忆沉淀成 git 里的 markdown,换 agent 就像换编辑器,资产跟着人走而不是跟着工具走。哪个模型最强每周都在变,但你的项目记忆不该陪葬。

单二进制加 markdown 是 agent 时代的 sqlite 时刻

这两个项目一个 Rust 单文件,一个 pip 装完就走,存储全是 markdown 和 SQLite 这种活了二十年的东西。大家试遍了向量库和 Kubernetes,最后回到最无聊的技术上做深。给 agent 配基础设施,透明和可审计正在压倒时髦。

完整榜单

排名仓库语言本期新增总 stars
1deepseek-ai/deepseek-harnessTypeScript+9,071158,854
2harry0703/MoneyPrinterTurboPython+2,306107,967
3public-apis/public-apisPython+1,907464,008
4anywhere-labs/deepseek-harness-desktopTypeScript+1,76413,377
5yetone/cumoraTypeScript+1,1282,241
6awesome-dsh-plugin/awesome-dsh-plugin-+1,0458,525
7llm-as-a-verifier/llm-as-a-verifierPython+8921,453
8Tiger3807861189/J-Space-Cognition-Suite-V3.6Python+8421,877
9usestrix/strixPython+78454,875
10akitaonrails/ai-memoryRust+7302,551
11mukul975/Anthropic-Cybersecurity-SkillsPython+72628,916
12basecamp/omarchyShell+71026,253
13OpenCut-app/OpenCutTypeScript+68284,572
14santifer/career-opsJavaScript+68265,275
15earendil-works/piTypeScript+64392,956
16agalwood/MotrixTypeScript+60753,495
17ifixai-ai/iFixAiPython+60210,502
18genlayerlabs/genlayer-project-boilerplateTypeScript+54315,846
19Tiger3807861189/DeepSeek-V4-J-Space-Capability-Realization-Report-+491919
20internet-court/internet-court-skillTypeScript+4323,890
21AlexsJones/llmfitRust+40032,626
22immich-app/immichTypeScript+371111,507
23jundot/omlxPython+36619,274
24truefoundry/trueforgeTypeScript+3271,211
25nautechsystems/nautilus_traderRust+31826,211

写在最后

三点收束。

第一,Agent 经济的完整拼图是场所加司法加账本加质检,8 月 18 号这一天四块都齐了轮廓,凌晨那篇讲了前两块,这篇补了后两块。

第二,记忆和验证都是横切层,不绑死任何 harness 和模型,这类项目会活得比大多数框架久。

第三,挑下限不挑上限,86.5 和 92.1 之间那 5.6 个点就是现在自动化验证的可靠边界,工程决策应该按这个边界做,而不是按发布会数字做。

一个总判断,别急着让 agent 更聪明,先把记账和质检这两个岗位配齐。记忆让努力不白费,验证让产出敢署名,这两件事比再涨一万星更接近生产环境。

评论互动

© 2026 王若风的技术博客 · Powered by Astro