GitHub 趋势洞察 2026-08-03:万亿参数塞进 8GB 内存,端侧推理彻底卷疯
- FareedKhan-dev/kimi-k3-in-c 用 176KB 的 C99 二进制跑起 2.78 万亿参数 Kimi K3,靠 MXFP4 原生 4-bit + KDA 固定 217MB + trunk streaming 2.37GB 环形缓冲,峰值 RSS 仅 8.24GB
- lyogavin/airllm 层流式架构只保留单层,per-expert streaming 让 2.8T 模型塞进 3.72GB,明确把 disk loading 作为换内存的代价
- 端侧推理四项目同榜,kimi-k3-in-c/sqliteai/waste/antirez/ds4 各走 CPU/NVMe/Metal 路线,把万亿模型跑进消费级硬件成为独立赛道
- stablyai/orca 一 prompt 扇出 5 个并行 agent 各自 git worktree,agent-agnostic 支持 30+ CLI agent,把多订阅变成并行舰队
- microsoft/skill-recorder 录制一次屏幕演示生成 SKILL.md,本地 Whisper 转录,经验沉淀从手写 skill 进化到录屏自动生成
今日 GitHub 趋势洞察,万亿参数塞进 8GB 内存
2026 年 8 月 3 日 · 本期共收录 25 个热门开源项目
今日焦点
今天榜单最该聊的不是谁又登顶了,而是一群人在干同一件听起来不可能的事,把万亿参数的大模型塞进消费级硬件。
先看一组数字。FareedKhan-dev/kimi-k3-in-c,C 语言,单日 +585,一个 2.78 万亿参数的 Kimi K3,在单颗 CPU 上跑,峰值内存 8.24GB,不依赖 GPU、不依赖 BLAS、不依赖任何框架。lyogavin/airllm,单日 +1,081(昨天还在 #18,今天冲到 #6),70B 模型在单张 4GB GPU 上推理,不量化、不蒸馏、不剪枝。
说真的,这俩项目放一起看,方向出奇地一致。airllm 是这个赛道的老选手,已经支持 Llama 3、Qwen、DeepSeek-V3、Mistral,2.8T 稀疏 MoE 模型只要 3.72GB。kimi-k3-in-c 是更激进的新人,纯 C99,整个推理引擎编译出来只有 176KB,却要驱动 1.56TB 的 checkpoint。再加上榜单上的 sqliteai/waste(NVMe 流式加载)、antirez/ds4(DeepSeek 4 的 Metal/CUDA/ROCm 本地引擎),端侧推理已经从「能不能跑」的实验阶段,正式进入「谁跑得更省更快」的军备竞赛。
这是今天最硬的主线。副线是 zhaoxuya520/reverse-skill 连续第三天上涨登顶,单日 +2,442,总星破 1.5 万,技能路由的势能还在持续。微软的 skill-recorder 新上榜,录一次屏就能生成可复用技能,经验沉淀有了新形态。
榜单前五深度解读
1. zhaoxuya520/reverse-skill
PowerShell,15,153 星,单日 +2,442,连续第三天上涨登顶。逆向/渗透/安全技能路由包。
它的核心设计昨天聊过,今天值得再拆一层。reverse-skill 解决的是 AI 做安全工作时的根本歧义,你让 AI 逆向一个 APK,它该用 jadx、apktool、Frida、IDA 还是 BurpSuite?做法是先跑 refresh-tool-index.ps1 扫描本机环境,生成 tool-index.md,让 AI 执行前就精确知道这台机器上有哪些可用工具。AI 选工具从「盲猜命令」变成「查索引再选」,准确率有数量级的提升。
真正让它持续霸榜的,是把渗透流程抽象成 ops contract。scope、evidence chain、roles、timeline,强制建立 auth 和 network_profile,没就绪就不许对目标动手。覆盖 20+ 安全方向,光 CTF-Sandbox-Orchestrator 就含 40+ sub-skills。坦白讲,这不是单一安全工具,是 meta-router 加操作契约管理器。连续三天上涨说明,安全社区真的缺这种把领域知识结构化的东西。
2. FareedKhan-dev/kimi-k3-in-c
C,742 星,单日 +585。2.78 万亿参数 Kimi K3,单 CPU,8.24GB 内存。
这是今天最硬核的项目,没有之一。说真的,整个推理引擎用纯 C99 写,编译出来 176KB 的二进制,要驱动 1.56TB 的模型 checkpoint。峰值 RSS 只有 8.24GB,能在 8GB 内存的机器上跑。它怎么做到的,靠四重内存缩减。
第一重,原生 4-bit 量化。Kimi K3 的 routed experts 本来就用 MXFP4 微缩格式(每权重 0.53125 字节),引擎直接在打包的 nibble 上做矩阵运算,永远不解量化,每个 token 省 194GB 的内存流量。第二重,Kimi Delta Attention(KDA)。93 层里有 69 层用 KDA,靠固定大小的循环矩阵替代不断增长的 KV cache,无论上下文多长,每序列固定 217MB。第三重,Multi-head Latent Attention(MLA)。剩下 24 层用全局注意力,但把 key/value 压缩成一个小潜在向量,每个位置的 cache 从 30,720 个 float 降到 576。
最狠的是第四重,trunk streaming。模型密集的「主干」部分 108.81GB,根本不进内存。引擎用循环扫描器 + 固定前缀 + 2.37GB 的旋转环形缓冲区,通过 O_DIRECT 在 hugepages 上直接读盘,绕过 OS 页面缓存。因为是稀疏 MoE,每层 896 个专家只有 16 个被激活,激活的专家通过 LRU cache 缓存。结果是,80% 的推理时间花在从 NVMe 读权重上,瓶颈在 I/O 不在算力。为了保证不同硬件路径输出完全一致,作者甚至禁用了 fused multiply-add(-ffp-contract=off)。
3. lyogavin/airllm
Jupyter Notebook,26,531 星,单日 +1,081。70B 推理,单张 4GB GPU,不量化不蒸馏不剪枝。
airllm 是端侧推理赛道的先行者,今天从 #18 暴涨到 #6。它的核心架构是层流式(layer-streaming),同一时刻 GPU 上只保留一层。因为 VRAM 需求严格取决于单层大小而不是整个模型,所以巨型模型能塞进小 GPU。405B 模型 8GB VRAM,671B 模型 12GB,2.8T 稀疏 MoE 只要 3.72GB。
对稀疏 MoE 架构,它用 per-expert streaming,只加载 token 实际需要的那条网络路径。这是 2.8 万亿参数能压进 4GB 的关键。可选 4bit/8bit 分块量化,只量化权重不量化激活以保精度,能加速最多 3 倍。跨平台支持 Linux、CPU、Apple Silicon(通过 MLX),还做了预取来重叠模型加载和计算。文档很坦诚地承认,瓶颈主要在磁盘加载,用流式换内存,disk I/O 延迟是代价。
4. firecrawl/pdf-inspector
Rust,7,167 星,单日 +1,769(昨天 #3,今天稳居前三)。PDF 检测、分类、文本提取库。
纯 Rust,无 ML 模型、无外部服务,只依赖 lpdf。判型不完整加载 PDF,直接解析 xref 表和 page tree,在 content stream 里找 Tj/TJ(文本)和 Do(图像)算子,采样 content stream 大约 10-50ms 就能判断扫描件还是文本件。表格检测用 union-find 算法合并绘制矩形,纯几何方法、没有任何机器学习,拿到 0.814 的表格分。ScanStrategy 支持 EarlyExit、Full、Sample、Pages 四种模式,把「是否要 OCR」从整本文档细化到页级。
5. stablyai/orca
TypeScript,36,327 星,单日 +640。并行 Agent 舰队的 ADE(Agent 开发环境)。
它解决的是订阅碎片化的问题。你手上可能有 Claude、Codex、Cursor 多个订阅,平时要切来切去。Orca 把它们统一成一个编排层,一个 prompt 能扇出 5 个并行 agent,每个跑在独立的 git worktree 里,你可以对比不同 AI 的输出,合并最好的结果。agent-agnostic,号称支持任何 CLI agent,列了 30+ 兼容工具(Claude Code、Codex、Cursor、Copilot、OpenCode、Devin 等)。
技术上几个细节值得提。SSH worktree 能在远程服务器或 VPS 上跑 agent,完整编辑能力、git 访问、自动重连。终端基础设施用 WebGL 渲染做高性能终端(对标 Ghostty),支持无限分屏、跨重启保留滚动历史。Design Mode 内嵌 Chromium 窗口,点 UI 元素能自动提取 HTML、CSS、截图喂进 AI prompt。还有 iOS/Android 移动端,能在手机上监控桌面 agent 进度、收完成通知、发后续指令。
趋势分析
端侧推理军备竞赛正式开打
今天的榜单给我一个极强的信号,端侧推理已经成了一条独立赛道。
kimi-k3-in-c、airllm、sqliteai/waste、antirez/ds4,四个项目同榜,各走一条技术路线。kimi-k3-in-c 走纯 CPU + 原生 4-bit + trunk streaming,airllm 走 GPU 层流式 + per-expert streaming,waste 走 NVMe 流式加载激活权重,ds4 走 Metal/CUDA/ROCm 本地引擎。你想想看,四条路线都在解决同一个问题,当模型大到内存装不下,怎么用更聪明的方式让它跑起来。
把这几条路线放一起,一个共同特征就浮出来了。它们都接受「瓶颈转移到 I/O」这个现实,不再幻想在消费级硬件上跑出数据中心的速度,转而把工程精力全压在「怎么让 I/O 更聪明」。kimi-k3-in-c 的 2.37GB 环形缓冲区、airllm 的单层驻留、waste 的 NVMe 流式,都是同一思路的不同实现。当这种优化集中爆发,端侧 Agent 的落地条件就真的具备了。
经验沉淀从手写进化到录屏
reverse-skill 三连涨登顶,微软 skill-recorder 新上榜,两个项目指向同一个方向,把人的经验变成 Agent 可用的资产。
reverse-skill 是手写路线,把逆向、渗透、安全的领域知识结构化成可路由的 skill 文件加 ops contract。skill-recorder 是录屏路线,你做一次表单提交,它录下来,本地用 Whisper 转录(支持 99 种语言,模型 252MB),再用 GitHub Copilot 重建成「一个总体意图 + 有序步骤列表」,输出一个 SKILL.md。关键区别在于,它不是盲目重放鼠标点击,而是生成泛化 procedure,录一个表单能让 Agent 学会提交所有同类表单。而且它优先用 Agent 的原生工具(比如 gh CLI、web_fetch),而不是模拟人类操作。
这两条路线其实是一回事。其实吧,无论是手写还是录屏,底层逻辑都是把人的隐性经验显性化成 Agent 能读的结构。差别只在入口,reverse-skill 要你懂领域、能手写契约,skill-recorder 只要你会做、能演示。后者把门槛降到了零。
Agent 编排走向多订阅并行
orca 和榜单上的 qm(#4,多人 Agent harness)放一起看,Agent 编排正在分化出两个方向。你想想看,同样叫 Agent 编排,qm 做的是多人协同,多个员工共享一个中枢 core,各自隔离的 workspace、memory、权限。orca 做的是多订阅并行,一个人手上多个 AI 订阅,一个 prompt 扇出 5 个 agent 各跑独立 worktree,对比合并。一个解决「团队怎么共用 Agent」,一个解决「个人怎么榨干多个订阅」。我一直觉得,当 Agent 订阅变成常态化开支,怎么编排这些订阅会成为一个独立的工程问题,orca 给了一个相当完整的答案。
值得关注的潜力项目
microsoft/skill-recorder
TypeScript,1,236 星,单日 +498。微软出品,录屏生成可复用技能。
录制完全在本地进行,捕获窗口切换、浏览器 URL(macOS)、屏幕视频、剪贴板预览、可选语音旁白。只有你点「Analyze」时,事件时间线、提取的图片和文本才会上传到 GitHub 云端给 Copilot 处理,录制过程数据不出本机。跨平台支持 macOS 和 Windows 11(x64 + ARM64),Electron + Vite 构建。
DietrichGebert/ponytail
JavaScript,94,588 星,单日 +578。让 AI Agent 像最懒的高级开发者一样思考。
它的理念很有意思,最好的代码是你根本不用写的代码。与其让 Agent 拼命生成代码,不如让它先判断哪些需求可以不实现、可以删掉、可以推迟。这是对「Agent 必须多产出才有价值」的一种反拨,9 万多星说明这个理念戳中了很多人的痛点。
FareedKhan-dev/kimi-k3-in-c 之外的端侧选手
sqliteai/waste,C,1,386 星,单日 +374。和 kimi-k3-in-c 处理同一个 2.78 万亿参数 Kimi K3,但走 NVMe 流式加载激活权重的路线,零依赖、可嵌入。antirez/ds4,C,20,253 星,单日 +385。Redis 作者 antirez 的新作,DeepSeek 4 Flash 和 PRO 的本地推理引擎,支持 Metal、CUDA、ROCm。这两个和 kimi-k3-in-c、airllm 一起,构成了端侧推理的完整光谱。
browser-use/video-use
Python,18,670 星,单日 +312。用 coding agent 编辑视频。
browser-use 团队的新作,把视频编辑变成 coding agent 能处理的任务。这个方向很值得关注,如果视频编辑能被 Agent 化,创作的门槛会进一步降低。
完整榜单
写在最后
第一,端侧推理军备竞赛正式开打。kimi-k3-in-c、airllm、waste、ds4 四个项目同榜,各走 CPU/GPU/NVMe/Metal 路线,都在解决「万亿模型塞进消费级硬件」。它们都接受瓶颈转移到 I/O,把工程精力全压在让 I/O 更聪明。当这种优化集中爆发,端侧 Agent 的落地条件才算真的具备。
第二,经验沉淀的入口正在降低。reverse-skill 要你手写领域契约,skill-recorder 只要你录一次屏。坦白讲,无论手写还是录屏,底层逻辑都是把人的隐性经验显性化成 Agent 能读的结构,但录屏把门槛降到了零。
第三,Agent 编排在分化。qm 做多人协同,orca 做多订阅并行,一个解决团队共用,一个解决个人榨干。当 Agent 订阅变成常态化开支,编排这些订阅会成为一个独立的工程问题。
一个总判断。今天这期榜单最该记住的不是 reverse-skill 又涨了多少星,而是端侧推理从「能不能跑」正式进入「谁跑得更省更快」。kimi-k3-in-c 用 176KB 的二进制驱动 1.56TB 的模型,airllm 把 2.8 万亿参数压进 3.72GB,这些数字本身就是宣言。当万亿模型能在笔记本上跑起来,大模型的使用门槛会被彻底改写。

评论互动