GitHub 趋势洞察 2026-08-22,token 账单的三路反击,FreeToken 把 290B 模型塞进游戏本
- FreeToken 发布首日拿下 +1,036 星,arXiv 论文作者名单里有 Song Han、Ion Stoica 和 Matei Zaharia,目标是让 290B MoE 在游戏本上跑。
- 它的三板斧是带宽自适应 CPU-GPU 协同执行、全局 LRU 专家缓存加双缓冲 prefill 流式,还有专为 agent 负载设计的语义锚点检查点。
- openai/codex 凭 0.149.0 的 agents dashboard 和 codex queue 冲回第一,+4,159,deepseek-harness 单日增量回落 44% 让出头名。
- webcmd 用四层学习架构把浏览器探索固化成 CLI 命令,官方号称省九成浏览 token,838 个 fork 对 1.3k 星的比值说明社区在抢着写适配器。
- Karpathy 一条讲 LLM 编码陷阱的推文被整理成单个 CLAUDE.md,28 个 commit 撑起 205,146 星,纪律文件正在成为新的 star 资产。
2026 年 8 月 22 日 · 本期共收录 25 个热门开源项目
今日焦点,账单到了第二天,反击的人到了
昨天的榜单讲的是账单。caveman 用穴居人语法砍输出 token,sub2api 帮人拼车订阅省 API 费,腾讯的红队平台负责上线前查漏。说真的,那期看完的感觉是 agent 派对散场,有人开始收拾杯盘。
今天的榜单给出的是回应,而且三路同时到。
推理路上,一个叫 FreeToken 的项目昨天刚发布,总星 1,092 里有 1,036 是 24 小时内涨的,名字起得直白,token 免费。浏览路上,webcmd 把 agent 反复探索同一个网站的浪费固化成可复用命令,号称砍掉九成浏览 token。行为路上,Karpathy 一条讲 LLM 编码陷阱的推文被整理成一份 CLAUDE.md 纪律文件,205,146 颗星挂在仓库上。
背景板也在换位。openai/codex 靠 8 月 20 号刚发的 0.149.0 冲回第一,+4,159,deepseek-harness 让出坐了一周的头把交椅,单日增量从昨天的 +5,525 回落到 +3,104。
一天之内,省 token 这件事从砍输出进化成了三线作战。
榜单前五深度解读
1. openai/codex · Rust · +4,159 · 112,664
重登第一靠的是 0.149.0,8 月 20 号发布。这版最有分量的是一个交互式 agents dashboard,能搜索、启动、打开、重命名、停掉任务,快捷键可配,等于把多 agent 调度台搬进了终端。配套的 codex queue 可以往已有的本地或远程会话里塞消息,唤醒空闲会话的修复也一并做了,这两件事合起来看,方向很明确,单个 agent 会话已经不是产品单位了,任务队列才是。
细节密度也够。TUI 新增 /cd、/pwd、/cwd 三个目录命令,vim 模式补了 cw、c$、cc 这些 change motions,codex doctor 现在会检查端点防护、网络代理、桌面应用状态和更新连通性。SDK 侧支持精确覆写 CLI 配置,reasoning effort 加了 max 和 ultra 两档。你想想看,一个终端工具把 doctor 这种运维思维做进来,说明用户群已经从尝鲜的极客扩到了需要排障的正经团队。仓库 9,685 个 commit,0.150.0 的 alpha 列车两天发了 6 班,每班 162 个二进制资产,四个平台目标全覆盖,工程节奏没松过。
2. deepseek-ai/deepseek-harness · TypeScript · +3,104 · 184,062
连坐了一周第一之后让位,单日增量从 +5,525 降到 +3,104,回落 44%。坦白讲,这个回落速度对一个发布第十天的项目来说不算崩,总星 184,062,fork 破 20,442,fork 与星的比例停在 11%,社区参与度依然远超一般框架项目。仓库还挂着 developer preview 的牌子,官方明说过会有破坏性变更,Everything is a Plugin 的架构和 Cordis 底座前几天聊透了,今天不重复。
真正值得记的是这个拐点的含义。codex 反超靠的是 agents dashboard 和任务队列,这两样恰恰是 harness 品类引以为傲的编排能力。官方 agent 开始收编 harness 的核心卖点,这个信号比谁排第一重要。
3. FlashML-org/FreeToken · Python · +1,036 · 1,092
今天最有料的新面孔。FlashML 出品的边缘推理引擎,一句话定位,让 290B 级别的 MoE 模型跑在游戏本上。配套论文 arXiv 2608.16157,作者名单拉开一看,Song Han、Kurt Keutzer、Matei Zaharia、Ion Stoica,系统和 ML 圈的豪华配置,这不是营销项目,是有备而来的学术工业合流。
技术路线针对的是 MoE 在消费级硬件上的真实痛点,显存装不下全部专家。它把 GPU、CPU、内存和互联带宽当成一个统一的弹性推理平台,用带宽自适应的 CPU-GPU 协同执行策略(论文里的 q* 策略)动态决定专家计算放哪边,配全局 LRU 专家缓存和全层双缓冲 prefill 流式,权重加载和计算重叠跑。自研的 FTW 快速权重格式,量化支持 MXFP4、NVFP4、FP8、BF16,模型侧点名 DeepSeek-V4-Flash、Qwen3.6-35B-A3B、GLM-5.2,硬件侧支持 RTX 30/40/50 系。
最值得盯的是语义锚点检查点。agent 负载的特点是上下文反复小改,插一个工具调用、删一段思考,传统引擎要把公共前缀重算一遍,它把循环状态和 KV 缓存锚定在语义检查点上,改动的部分增量算。还有弹性显存,专家缓存和 KV 内存之间运行时重新分配,不用重启不用重载权重。工程血统也老实,README 明说受 mini-sglang 启发,复用了 SGLang、vLLM、FlashInfer、llama.cpp 的代码和设计。API 层做了 OpenAI 和 Anthropic 兼容,Codex、Claude Code、OpenCode 可以直接把本地端点当后端用。
其实吧,把这条和昨天的账单连起来看才完整,token 贵,那就把弹药库搬回家。
4. agentrhq/webcmd · JavaScript · +641 · 1,277
浏览器是 agent 最烧 token 的地方之一,每换一个网站都要现场摸索页面结构。webcmd 的解法是让基础设施自己学,四层架构层层递进。第 0 层是真浏览器,Playwright 风格的沙箱程序跑真实会话,检查、点击、输入、抓网络请求。第 1 层是站点记忆,把观察到的页面、状态、动作、工作流、API、坑和兜底路径沉淀成 agent 视角的 sitemap。第 2 层基于记忆生成可复用的 webcmd 适配命令,结构化输出。第 3 层最省,工作流完全确定之后直接往现有 CLI 里加定制命令,后来的 agent 一个 token 都不用花在导航上。
会话模型设计得干净,Profiles 是 cookie 罐,Sessions 是 profile 里的独立浏览器窗口,并行 agent 各拿各的 session 不打架。核心 npm 包不内置任何站点适配器,全部走 webcmd plugin search 安装,社区已有 omnisearch(HN、Stack Overflow、GitHub、arXiv)、pypi、skyscanner 这些插件,还能用 webcmd skills add 挂进 Claude 或 Codex。
数字层面要泼一瓢冷水。up to 90% 的节省目前只在 README 里,仓库有 benchmarks 目录但首页没放具体结果,1.3k 星配 838 个 fork,这个比值说明抢着贡献适配器的人比围观的多,社区在真干活。我一直觉得这种结构的项目,fork 数比星数诚实。
5. multica-ai/andrej-karpathy-skills · - · +589 · 205,146
一个仓库,28 个 commit,205,146 颗星。内容是一个 CLAUDE.md 文件,把 Karpathy 那条讲 LLM 编码失败模式的推文翻译成了可执行的纪律。失败模式三条,模型默默做错误假设不问人,代码过度工程化,顺手改掉或删掉自己没看懂的代码。
文件展开成四个原则。Think Before Coding,假设要显式说出来,歧义时给出多种解读,有更简单的方案就顶回去。Simplicity First,不给单次使用的代码造抽象,不做没人要的可配置性,给不可能的场景写错误处理,判据写得很狠,200 行能写成 50 行就重写。Surgical Changes,每一行改动都必须能追溯到用户的请求,既有的死代码提一嘴但不删。Goal-Driven Execution,把祈使句任务转成可验证的目标,修 bug 先写能复现的测试再让它过。整个文件的灵魂是 Karpathy 那句判断,Don't tell it what to do, give it success criteria and watch it go,别告诉它怎么做,给它成功判据然后看它跑。
仓库还配了等价的 Cursor 规则文件、示例文档和中文 README,安装可以走插件市场也可以一条 curl 拉进项目。有意思的是它标注了代价,这套纪律偏保守,速度上会有损失。一份文件自己写明了 tradeoff,这比多数框架文档都体面。
趋势分析
省 token 的战场从 prompt 层沉到基础设施层
昨天的 caveman 在输出端做压缩,今天 FreeToken 直接换掉了弹药供给端,把推理搬回本地,webcmd 换掉了交互端,把浏览器探索固化成命令。你想想看,同一个问题,三个层次各自的解法同天上榜,这不是巧合,是成本压力大到单点优化不够用了。接下来值得等的是三层的组合,本地跑 290B 模型,浏览器导航走缓存命令,输出端再压一道,账单能压到什么程度,很快会有项目给出完整答案。
纪律文件成了新的 star 资产
把今天榜单里 skills 相关的项目数一遍,mattpocock/skills 231,388,superpowers 276,024,karpathy-skills 205,146,ECC 242,058,ui-ux-pro-max-skill 119,700,ponytail 107,968,book-to-skill 24,019,awesome-gpt-image-2 12,122,25 席占了 8 席。其中最极端的是 karpathy-skills,28 个 commit 对 20 万星,一个文件的价值超过了绝大多数框架。方法论本身成了可分发的资产,而且这个品类的生产成本趋近于零,一条推文、一篇博客、一段经验,整理成 SKILL.md 就能上线流通。我一直觉得这波 skills 热的本质不是技术,是知识第一次有了标准的打包格式。
harness 品类从爆发期进入拉锯期
dsh 单日 +5,525 到 +3,104 的回落,配上 codex 的反超,是这十天 harness 叙事的第一个转折点。官方 agent 用 agents dashboard 和任务队列证明,harness 的编排能力可以被收编进现有产品。第三方也没停,trueforge 第 13 位稳步爬到 3.4k,走的是 MIT 协议加沙箱加 YAML 目录的差异化路线。品类成型之后的第二阶段,拼的不再是发布声量,是工程深度和留存,谁能把 developer preview 的牌子摘掉,谁才算真正落地。
值得关注的潜力项目
floci-io/floci(第 21 位)
LocalStack 社区版今年 3 月停服、要求 auth token、冻结安全更新之后,AWS 本地模拟这块留出了真空,floci 是来填坑的。Java 写的,MIT 协议,72 个 AWS 服务,单端点 4566 端口,启动 24 毫秒,空闲内存 13 MiB,Docker 镜像 90 MB,对位 LocalStack 的 3.3 秒、143 MiB、1.0 GB。状态型服务 S3 和 DynamoDB 进程内模拟,Lambda、RDS、EKS 这些起真容器,还有 2,506 个自动化兼容性测试横跨 Java、Node、Python、Go、AWS CLI、Terraform 和 CDK。环境变量自动翻译,LocalStack 的初始化脚本原样能跑,迁移成本压到了最低。
truefoundry/trueforge(第 13 位)
agent harness 赛道里 dsh 之外的另一个正经选项。MIT 协议,本地模式一条 npx 起 SQLite 单进程,托管模式 Postgres 加 Redis 加 Helm。模型接 OpenAI、Anthropic、Gemini 或任意兼容端点,沙箱当工具用,现在跑 Daytona,密钥留在 harness 层不进沙箱。上下文工程是卖点,子 agent、延迟工具加载、大结果卸载、压缩一整套。官方声称在相同任务相同模型下与 Claude 托管 agent 和 deepagents 同准确率更低成本,基准数字还没公开,先看仓库再信。
cursor/plugins(第 23 位)
Cursor 的插件规范和官方插件仓库,4,584 星。IDE 阵营正式跟进插件化这件事,和 Claude 的 plugin marketplace、Codex 的生态扩张放在一个时间轴上看,编辑器、终端、harness 三条线都在往同一个方向收敛,扩展机制标准化。规范类仓库的星数从来涨得慢,但它们定义的接口决定后面几年的生态形状。
完整榜单
| 排名 | 仓库 | 语言 | 本期新增 | 总 stars |
|---|---|---|---|---|
| 1 | openai/codex | Rust | +4,159 | 112,664 |
| 2 | deepseek-ai/deepseek-harness | TypeScript | +3,104 | 184,062 |
| 3 | mattpocock/skills | Shell | +2,684 | 231,388 |
| 4 | FlashML-org/FreeToken | Python | +1,036 | 1,092 |
| 5 | AprilNEA/OpenLogi | Rust | +959 | 13,608 |
| 6 | ripienaar/free-for-dev | HTML | +915 | 133,742 |
| 7 | agentrhq/webcmd | JavaScript | +641 | 1,277 |
| 8 | MengTo/threeui | HTML | +628 | 1,276 |
| 9 | obra/superpowers | Shell | +592 | 276,024 |
| 10 | multica-ai/andrej-karpathy-skills | - | +589 | 205,146 |
| 11 | basecamp/omarchy | Shell | +538 | 28,041 |
| 12 | DietrichGebert/ponytail | JavaScript | +514 | 107,968 |
| 13 | truefoundry/trueforge | TypeScript | +499 | 3,405 |
| 14 | arvids-unavailable/openGym | JavaScript | +493 | 1,057 |
| 15 | freestylefly/awesome-gpt-image-2 | JavaScript | +487 | 12,122 |
| 16 | mahlernim/google-timeline-visualizer | Kotlin | +441 | 2,504 |
| 17 | modular/modular | Mojo | +395 | 28,796 |
| 18 | nextlevelbuilder/ui-ux-pro-max-skill | Python | +360 | 119,700 |
| 19 | affaan-m/ECC | JavaScript | +357 | 242,058 |
| 20 | virgiliojr94/book-to-skill | Python | +355 | 24,019 |
| 21 | floci-io/floci | Java | +303 | 21,120 |
| 22 | PostHog/posthog | Python | +288 | 38,499 |
| 23 | cursor/plugins | TypeScript | +286 | 4,584 |
| 24 | Wei-Shaw/sub2api | Go | +264 | 38,729 |
| 25 | tonenewttrowel/iptv-lab | - | +264 | 431 |
写在最后
三点收束。
第一,FreeToken 首日上榜的信号比它的星数大。Song Han 和 Ion Stoica 这个级别的作者阵容下场做消费级 MoE 推理,说明学界认了这件事的工程价值,本地跑前沿模型的窗口正在被认真打开,语义锚点检查点这种专为 agent 负载设计的能力,方向感非常准。
第二,纪律文件拿星的速度超过了框架。karpathy-skills 用 28 个 commit 撑起 20 万星,skills 品类占比八席,知识打包成 SKILL.md 的流通效率已经得到市场验证,写清楚成功判据比多写一千行框架代码值钱。
第三,harness 的故事进入第二幕。dsh 增速回落四成,codex 用 dashboard 和 queue 反超,爆发的红利期结束,接下来比的是谁先把 developer preview 的牌子摘掉,谁能把插件生态从皮肤和桌宠升级成生产力。
一个总判断,agent 技术栈正在分形成三层各自独立的成本战场,弹药层(推理)、交互层(工具调用)、行为层(纪律),今天三路同时有人交卷。下一匹黑马大概率出现在把这三层串起来的组合位上,谁先做出本地推理加缓存命令加纪律文件的完整闭环,谁就拿到账单战争的终局门票。

评论互动