GitHub 趋势洞察 2026-08-12,antirez 出手,Redis 作者用 C 把 33B 视频模型塞进 Mac
- antirez 用 C + Metal 4 + INT8 写了 MiniMax H3 的 Mac 推理引擎,33B 视频模型本地 19 秒出图
- MiniMax H3 是 33B dense 全模态模型,能吃图文视频音频,吐 2K 视频和立体声
- prime-agent 用 RLM 把 context 当变量,靠 /refine 做证据驱动的自我改进
- semantica 走图谱 + 确定性推理路线,给金融医疗等高合规场景的可审计 AI 铺基建
- Agent Skills 赛道从爆发进入稳态,diagram-design 多日霸榜,skills 成了默认包装
今日 GitHub 趋势洞察,antirez 出手日
2026 年 8 月 12 日 · 本期共收录 25 个热门开源项目
今日焦点
今天榜单最值得说的,不是排第一的那个,是排第六的。
antirez,Salvatore Sanfilippo,Redis 的作者。这个人写过的代码撑起了大半个互联网的缓存层。他今天上榜的项目叫 h3.c,用 C 写的,给 MiniMax 刚发布的 H3 模型做 Mac 上的推理引擎。一个写 Redis 的人,转头去给视频生成模型手写 GPU 内核,这件事本身就够离谱。
更离谱的是他做到了什么。MiniMax H3 是个 33B 参数的全模态大模型,能吃文本、图片、视频、音频,吐出带立体声的 2K 视频。正常跑这种模型得靠云端的 A100 集群。antirez 用纯 C 加 Apple 的 Metal 4 框架,在 M5 Max 上把这个 33B 的怪物跑通了,一帧 512×512 的图 19.32 秒出来。同一天,MiniMax 官方的 H3 仓库排在第四,antirez 的 C 引擎排在第六,两件事在同一张榜上联动。
把视线拉远一点,说真的,今天的整张榜其实是个「稳态」。diagram-design 连续第二天霸榜第一,prime-agent、agency-agents、firecrawl 这些名字你这几天都看熟了。Agent Skills 这个品类,从八月初的爆发,已经走到了「不再是新闻」的阶段,skills 成了 Agent 工具的默认包装方式。真正还在冒新氧气的,是模型层和本地推理层。antirez 这一锤,就是今天那点新氧气里最响的。
榜单前五深度解读
1. cathrynlavery/diagram-design · HTML · +1,612 · 6,036 ⭐
连续第二天榜首。一个 Claude Code skill,把编辑级图表的设计规格(4px 网格、9 节点上限、单一强调色、5 条强制连接线规则)编码成 LLM 能执行的规则。昨天我专门拆过它,最尖锐的发现是,它标榜「non-negotiable」的 4px 网格和连接线规则,实际没有任何脚本强制校验,唯一能跑的 lint 只查颜色和字体。能连续霸榜说明需求真实,但说真的,它的「保证」止于调色板。
2. PrimeIntellect-ai/prime-agent · TypeScript · +1,148 · 13,832 ⭐
这期榜单技术上最硬的 Agent 项目。它叫自己 RLM,Recursive Language Model,递归语言模型。核心思路是把 context 当成变量,prompt-as-a-variable,把工具调用和子 agent 都当成 REPL 里的函数调用。底层是一个常驻的 IPython 进程当万能工具,文件操作、shell 命令全靠执行代码完成。
它最值得说的是「自我改进」。有个 /refine 命令,agent 会评估自己当前的执行轨迹,做小幅度的、有证据支撑的更新,把学到的东西写进补充状态里。关键约束是,它永远不会改写不可变的基础系统 prompt,而且每次更新都留快照,能回滚。这比那些号称「自我进化」实际只是乱改 prompt 的项目严谨得多。另外它还能用 rlm(...) 函数调用直接 spawn 真正的子 agent,多个运行中的 agent 能自己互相发现、交换消息,不用把所有东西都路由给用户。顺带一提,它建在另一个上榜项目 pi(第八名,8.7 万星)之上。
3. msitarzewski/agency-agents · Shell · +971 · 142,673 ⭐
星数最高,但含金量最低的一个。14 万星,2.3 万 fork,主语言是 Shell。从描述看是一整套 AI agency 的 agent 人格集合,从前端到社区运营各种角色。你想想看,一个 Shell 项目 14 万星 2.3 万 fork,fork/星比高得反常,基本可以判断是个 prompt 和配置的合集,不是有架构的框架。它上榜说明「拿来即用的 agent 人格包」有市场,但别期待里面有工程深度。
4. MiniMax-AI/MiniMax-H3 · Python · +918 · 5,144 ⭐(含 #6 antirez/h3.c 联动)
今天真正的主角,拆成两个仓看才完整。
先说模型本身。H3 是个 33B 参数的 dense 单流 Transformer,不是 MoE。其中约 13B 参数在 AdaLN 分支里,纯推理时可以预算好然后省掉。编码器直接用了 Qwen3-VL-32B 的完整权重,注意力用的是三维多模态旋转位置编码(MM-RoPE)。能力上,它能一次吃进最多 12 个文件(9 图 + 3 视频 + 3 音频加文本),输出最长 15 秒、24 帧、最高 2K 的视频,配 32kHz 立体声,稳定支持 11 种语言。有个细节挺巧妙,2K 输出不是靠后接一个超分模型,而是把 768p 的结果喂回自己的基座模型重新生成,复用原始上下文把小字这种细节捞回来。
然后是 antirez 的 h3.c。这才是今天榜上工程含量最高的东西。33B 模型在 Mac 上跑,第一道关是内存。他用 mmap 把 37 GiB 的 transformer 权重直接从 safetensor 分片映射进来,文件支撑、可回收。再开一个 --ssd-streaming 模式,同一时刻只留两个 transformer block 在内存里,把跟踪用的 DiT 存储从 36.5 GiB 压到 2.0 GiB,代价是每次前向慢 84%(1.35 秒变 2.49 秒)。
计算这边的优化更狠。原生 BF16 Metal 4 TensorOps 跑矩阵投影和注意力,外加一套动态量化的 INT8 MLP 引擎,激活值动态量化、权重按输出通道缩放。在 M5 Max 上,一帧 512×512 的渲染,BF16 是 36.30 秒,换 INT8 降到 25.80 秒,再把注意力层也融成 INT8,干到 19.32 秒。一套完整的带 H.264 视频和 32kHz 立体声的多模态输出,74 到 77 秒跑完,峰值物理内存 40.1 GB。说真的,他几乎是把一个 PyTorch 推理管线该有的每一层,都用 C 和 Metal Shading Language 重写并融合了一遍,连 MLP 的残差门都跟下一个 block 的注意力 AdaLN 融在一起算,省掉派发开销。这就是为什么用 C,不是为了复古,是要榨到每一层内存往返都省掉。
5. semantica-agi/semantica · Python · +884 · 4,682 ⭐
一个反潮流的项目。现在做 AI 记忆和检索,默认都是向量库加 embedding。semantica 走图谱,Graph-Native。它把数据映射成实体、关系、事件的网,一个 AI 决策本身就是一个有一完整生命周期的图节点。存储是混合的,既支持 W3C 标准的 RDF 三元组(Oxigraph、Blazegraph),也支持属性图(Neo4j、Neptune)。
最关键的是它敢说「核心逻辑不需要 LLM」。推理走确定性的前向链、Rete 网络、Datalog、SPARQL,每条事实都挂 W3C PROV-O 的溯源,能追回原始文档。还有双时态图,区分「有效时间」和「记录时间」,能查回某一天图的状态。坦白讲,这套东西的受众很明确,金融、医疗、国防这种被监管、要审计的场景。在一个所有人都往 LLM 里堆算力的年代,有人重新把确定性推理和可审计性捡回来,这件事本身值得记一笔。
趋势分析
Agent Skills 不再是新闻,是地基
八月头十天,skills 赛道经历了从「新物种」到「基础设施」的快速沉降。diagram-design 多日霸榜,anthropics/skills(16.7 万星)和 addyosmani/agent-skills(8.6 万星)长期在榜,加上 agency-agents 这种人格合集 14 万星。其实吧,当一个品类同时有官方仓、个人作品集、和打包合集三类项目都稳定上榜,它就已经过了「值得大惊小怪」的阶段。skills 成了 Agent 工具的默认交付单位,就像 npm 包之于前端。接下来的看点不是「又出了一个 skill」,而是谁能给 skills 做出可靠的运行时和分发机制。
本地推理把 C 语言重新拽回了牌桌
我一直觉得,antirez 的 h3.c 不是孤例。往回看几天,8 月 3 日那期 Kimi K3 端侧推理也在卷本地化。这一波本地跑大模型的浪潮里,真正在出性能的不是 Python,是 C、C++、Metal、CUDA。原因很现实,33B 参数的模型塞进 Mac 的统一内存,每一层 kernel 融合、每一次内存往返的节省,都直接换算成能不能跑、跑多快。Python 和 TS 把 Agent 的逻辑层做厚了,但只要往下探到模型执行,低层语言就重新成了硬通货。antirez 这一手等于在提醒,推理性能的天花板,还是握在会写 GPU 内核的人手里。
Agent 开始被要求「解释自己」
semantica 进前五,prime-agent 强调证据驱动的自我改进,这不是巧合。当 Agent 从 demo 走向生产,尤其是金融医疗这种场景,「它为什么这么决定」 suddenly 比「它能不能做」更重要。semantica 的图谱加确定性推理、prime-agent 的不可变基础 prompt 加回滚快照,都是同一个方向的不同切面,给 Agent 的行为加上可追溯、可审计的约束。这个需求才刚冒头,但大概率是下一阶段的基建主题。
值得关注的潜力项目
QwenLM/Qwen-MM-Plugins · #10 · 1,813 ⭐
通义千问官方仓,定位是「让任何 agent harness 变成多模态原生」。星数不高但出身正,做的是把多模态能力插件化、接到现有 agent 框架上这一层。如果 Qwen 的多模态模型后续被广泛采用,这个插件层会是个卡位。
duolahypercho/codex-router · #16 · 1,705 ⭐
给 Codex 接外部模型的路由器,支持 Kimi OAuth/API、DeepSeek,带安全迁移和回滚。坦白讲,和我之前拆过的 opencodex 是同一类东西,解决「不想被绑在单一模型上」的需求。这类小工具会越来越多,因为编码 Agent 的模型层正在快速分化。
connorgallopo/Tracearr · #22 · 2,548 ⭐
跟 AI 没关系的清流。给 Plex、Jellyfin、Emby 这些自建媒体服务器做实时监控,追踪播放流、分析会话、检测账号共享。一千多星说明自建流媒体社区体量不小,这种垂直运维工具 niche 但刚需。
完整榜单
写在最后
第一,antirez 这一锤的意义不在 MiniMax H3 本身,在于它示范了「33B 模型可以在消费级硬件上靠手写 C 跑起来」。当云端推理还在按 token 收费,本地推理的体验下限正在被一群写底层的人快速抬高。
第二,Agent Skills 赛道正式进入稳态。接下来的机会不在「再做一个 skill」,在给 skills 做运行时、做分发、做质量门槛。diagram-design 那种把审美编码成规格的思路,是 skill 设计该有的方向,但它也暴露了规格若没有机器校验就只是愿望的软肋。
第三,可审计性是个刚冒头但确定的信号。semantica 的确定性推理、prime-agent 的证据驱动改进,都在给 Agent 加约束。toB 场景里,「为什么这么决定」迟早比「决定对不对」更值钱。
一个总判断,今天的榜单,Agent 的逻辑层在 Python 和 TS 里趋于饱和,真正的增量机会被挤到了两头,一头是模型执行层(C、Metal、CUDA),一头是 Agent 行为的约束和审计层。中间的逻辑编排,已经卷不动了。

评论互动