GitHub 趋势洞察 2026-09-14,垂直 Agent 分科,评审渗透研究和销售同一天抢席
- 垂直 Agent 按工种分科,评审、渗透、研究、销售同一天挤上榜
- 阿里 open-code-review 用确定性管道加 Agent,token 消耗约等于通用 Agent 的九分之一
- PentAGI 把渗透拆成研究、开发、执行三岗,硬限制工具调用次数
- Claude-Red 用 78 个 skill 覆盖 23 类攻击面,OpenResearch 用 git worktree 隔离并行研究
- Optimizer-Toolkit 空仓加远程脚本仍占第三,灰色手法没有退
2026 年 9 月 14 日 · 本期共收录 25 个热门开源项目
今日焦点,技能栈有了工种
gods-eye-view 继续坐庄,+2,898 领跑,总星 31,293。VoiceStudio 昨天还在深挖名单里,今天直接 +2,546 把自己推到亚军,总星 25,976。讲真,这两个项目已经不需要再介绍一遍,一个把真卫星数据喂进浏览器,一个把 ElevenLabs 搬进本地硬盘,长跑和本地语音各自有各自的观众。
我更想看后面那排新面孔。
第 16 位的阿里 open-code-review 把两年内审工具开了源,第 7 位的 PentAGI 把渗透测试拆成研究、开发、执行三岗,第 10 位的 Claude-Red 塞进 78 个进攻技能,第 24 位的 OpenResearch 让研究 Agent 一人一棵 git worktree,第 15 位的 DeskcommCRM 把销售操作系统自托管。昨天技能栈刚成型,今天这些技能开始按工种领工牌。
这不是又一个写代码的日子。
灰色那边也没走。第 3 位的 Optimizer-Toolkit 仍然是空仓加远程脚本加关杀软,+1,089,总星 3,770,两个 commit,两个 watcher。排名比昨天那批灰色仓库还靠前。
榜单前五深度解读
1. alibaba/open-code-review · Go · +438 · 23,068
阿里巴巴集团内部用了两年的官方 AI 代码评审助手,服务过数万开发者,标称检出过百万量级缺陷,今天以 Apache-2.0 开源。npm 包名 @alibaba-group/open-code-review,命令是 ocr,要求 Git 2.41 以上。
它要解决的不是模型会不会看代码,是纯语言驱动的评审会漏文件,评论钉错行,提示词一改质量就漂。仓库把根因写得很硬,必须做对的步骤由工程逻辑保证,不交给模型发挥。确定性管道负责选文件、按关联打包、给每个包开隔离上下文的子 Agent、用模板匹配规则、把评论钉到精确行号再做质量回查。模型只在需要判断的地方出场,可以打开完整文件、搜仓库、看兄弟 diff,不局限于当前 hunk。内置规则覆盖空指针、线程安全、XSS、SQL 注入,端点兼容 OpenAI 和 Anthropic。
基准叫 AACR-Bench,50 个热门仓库,200 个真实 PR,10 种语言,1,505 个由 80 多名资深工程师标注的问题。同一模型下,对比通用 Agent(Claude Code),精确率和 F1 显著更高,token 大约只花九分之一,墙钟时间也更短。召回率更低,这是刻意的,宁可少报,也不要一堆误报。坦白讲,两年坑写成管道再塞模型,这种开源我买账。
2. vxcontrol/pentagi · Go · +613 · 23,783
全自主渗透测试 Agent 系统,MIT 协议,Go 后端加 React 前端加 GraphQL,数据落在 PostgreSQL 和 pgvector。界面默认绑在本机 8443 的 HTTPS。它不是 CALDERA 那种预置剧本库,用户用自然语言给范围和目标,编排器从向量库里捞相似案例,再按岗派活。
三岗分得很清楚。研究员做目标分析和已知问题检索,开发者根据库存技战法和工具能力做攻击计划,执行者在沙箱里跑计划并落盘。数据模型是 Flow 到 Task 到 SubTask 到 Action,记忆分长期、工作、情节三层,膨胀的对话会按 ChainAST 做链式摘要,工具调用结构还在。监督不是靠人盯着,硬限制一直开着,通用 Agent 默认 100 次工具调用,搜索类默认 20 次,连续 3 次发不出合法工具就由反射器往 done 或 ask 上赶。执行监视器默认关,打开后在 Qwen3.5-27B-FP8 上质量大约翻倍,时间和 token 大约两到三倍。
沙箱走独立 Docker 网络,生产建议两节点,不信任的执行放专用 worker。推荐 TLS 加固的 Docker-in-Docker,明确劝你别把宿主机 Docker 套接字挂进去。工具二十多种,nmap、Metasploit、sqlmap 都在。本地生产路径写过一组数字,vLLM 跑 Qwen3.5-27B-FP8,4 张 RTX 5090 上提示约 13k TPS、补全约 650 TPS,能并发 12 个以上 Flow。你想想看,渗透 Agent 真正难的不是会不会用 nmap,是谁来限制它别在循环里把自己烧穿。
3. SnailSploit/Claude-Red · Python · +507 · 3,952
给 Claude Skills 系统准备的进攻安全技能库,MIT 协议,78 个技能,23 个类别,路线图写到大约 130 个。安装方式是克隆进 ~/.claude/skills/claude-red,对话触发匹配才加载,用不到的类别不进上下文。也可以按目录稀疏克隆,或用 install.sh --category 只装一类。
覆盖面按攻击面拆开,Web 16 个从 SQLi 到请求走私,无线 14 个从 802.11 到 LoRaWAN,利用开发 6 个,红队基础 7 个,还有云、移动、容器、CI/CD、供应链、社会工程,外加一个专门打提示注入、越狱和 RAG 投毒的 AI 类。每个技能是一份结构化的 SKILL.md,不是一段随手 prompt。作者写过一句定位,给对技能,Claude 就不再是聊天机器人,它变成操作员。
老实讲,昨天 i-have-adhd 证明 Skill 能当安装包,今天 Claude-Red 证明安装包能按攻击面拆 SKU。授权红队、漏洞赏金、CTF 备课是它自己划的使用边界,这个边界写在仓库里,不写在星数里。
4. alphaXiv/OpenResearch · Rust · +304 · 1,893
用任意模型跑并行研究 Agent 的本地环境,Rust 二进制,命令是 orx,默认只绑 127.0.0.1:4791,状态放 SQLite,MIT 协议。总星才 1,893,fork 139,在这张榜上几乎是最小的正经仓库,也是最清楚的研究工种样本。
核心设计是一人一条线。每个研究方向单独开会话,单独一棵 git worktree,Agent 之间不共享脏树。实验图记录父子谱系,自动研究可以循环,提出改动、改代码、拉起一次 run、看日志,再决定下一轮。同一份提交快照能在笔记本、SSH 远端、Slurm、Kubernetes、Ray、Hugging Face Jobs、Modal 上跑。Agent 后端接 Claude Code、Codex、OpenCode、Cursor,技能用 orx install-skills 装。
其实吧,研究 Agent 最容易把探索、实验和证据搅在同一段聊天里。OpenResearch 做的事很土,把这三样用 worktree 和实验图切开。创建项目和 run 默认不上云,账号只为组织和托管算力服务。本地优先在这里能核对,默认只绑环回地址。
5. melgarafael/DeskcommCRM · TypeScript · +444 · 2,074
开源的 AI 销售操作系统,自托管 CRM,原生 Agent 加 WhatsApp,对着 Kommo、Octadesk、Intercom 这些按月收费的聊天销售套件。Next.js 16、React 19、TypeScript 6,数据在 Supabase Postgres,RLS 加 vector 做 RAG,聊天走 WAHA Plus 或 Meta Cloud API。HTTP 规范路径下有 196 个路由处理器,文档 157 篇,提交 4,016 次,推荐 4 GB 内存。
Agent 不是装饰,按租户做 RAG,技能可执行,组织记忆在,情绪识别在,AI 到人的交接留审计,AI 本身是一等公民的负责人,还有花费上限。自动化是 WHEN/IF/THEN,每分钟被 cron 抽干。多租户加 LGPD,CI 里有跨两个组织的隔离门,审计日志只追加,留 5 年。Playwright 规格 48 过 49。我一直觉得销售这条线被 coding Agent 的声量压太久了,一个能在 WhatsApp 上值守、打分、推漏斗的自托管系统,这更像 Agent 出圈的现场,IDE 插件已经看够了。
趋势分析
工牌比框架先到
今天榜上真正多出来的,不是又一个通用 Agent 框架。open-code-review 是评审岗,PentAGI 是渗透岗,Claude-Red 是进攻技能岗,OpenResearch 是研究岗,DeskcommCRM 是销售岗,YuE2 甚至把音乐编辑做成可检查的乐谱计划。同一天五条垂直线挤上榜,说明市场在用岗位投票,不再用「Agent」这个空词投票。
怎么说呢,技能栈解决的是怎么分发,工种解决的是分发给谁。昨天的安装包今天开始印工牌。
确定性管道把 Agent 拴住
五条垂直线有一个共同动作,先把不该错的步骤从模型手里拿走。评审用确定性管道选文件钉行号,渗透用 100/20 的工具调用上限和反射器收口,研究用 git worktree 隔离脏树,销售用 RLS 和只追加的审计。自由发挥留在判断层,执行层全部工程化。
Agent 越能干,越需要被拴住。
这和去年把一切丢进一个超级 Agent 的思路正好反过来。大厂用两年生产数据证明,九分之一的 token 加更高精确率,换来的是噪声更少,不是能力更弱。
第三席还是空仓
Optimizer-Toolkit 无语言,无源码,README 指向 true-soft.su 的远程 PowerShell,安装指引里有绕过执行策略和关掉 Defender。两个 commit 对 3,770 星,两个 watcher。手法和本专栏点名过的那批完全同一套,空仓库、站外加载器、关杀软、SEO 关键词农场。
说真的,灰色仓库的数量可以回落,位置却可以更靠前。平台过滤跟不上换壳,读者只能继续用三查,有没有真源码,安装是不是远程脚本,要不要你关杀软。三条挡得住绝大多数坑,点名挡不住换马甲。
值得关注的潜力项目
multimodal-art-projection/YuE · Python · +500 · 7,606
YuE2 把写歌拆成可检查的符号计划。架构是自回归加非自回归的 Mixture-of-Transformers 先出乐谱和语义 token,再 flow matching 填声学潜变量,VAE 解成 48 kHz 立体声,中间没有量化。检查点 YuE2-3B,需要 24 GB 显存。零样本翻唱靠 SheetSage2 把录音转成 ABC,948 首作品上,带完整乐谱的 CLEWS mAP 是 0.647,关掉乐谱只剩 0.006。WildSongBench 192 条提示、17 个系统里,YuE2 八选一均值 6.9632,略高于 Mureka 9 的 6.9377 和 Suno v5 的 6.8721。音乐编辑也走 Agent,改 ABC 再整曲重录,演示里一首歌走过 9 步 14 个版本。分科分到作曲这一行有点超纲,但方向是真的。
feder-cr/AIHawk · Python · +343 · 30,694
隐身 Firefox 上的浏览器 Agent,宣传点是不被反爬标记、不触发验证码。任务用白话下,计算机使用 Agent 加浏览器 MCP,对接 Claude Code 和 Gemini CLI。总星已经 30,694,今天的增量不算暴,但它把「眼睛」这条工种补在 PentAGI 的执行器和 DeskcommCRM 的聊天管道旁边。Agent 要出圈,总得有一双不被网站当场踢走的手。
完整榜单
| 排名 | 仓库 | 语言 | 今日新增 | 总 Stars |
|---|---|---|---|---|
| 1 | bilawalsidhu/gods-eye-view | JavaScript | +2,898 | 31,293 |
| 2 | debpalash/VoiceStudio | Python | +2,546 | 25,976 |
| 3 | ScalarLinkAxe/Optimizer-Toolkit | - | +1,089 | 3,770 |
| 4 | google/artemis | Python | +791 | 4,367 |
| 5 | asgeirtj/system_prompts_leaks | JavaScript | +727 | 65,831 |
| 6 | JustVugg/colibri | C | +652 | 29,236 |
| 7 | vxcontrol/pentagi | Go | +613 | 23,783 |
| 8 | tonhowtf/omniget | Rust | +547 | 11,334 |
| 9 | Panniantong/Agent-Reach | Python | +531 | 80,242 |
| 10 | SnailSploit/Claude-Red | Python | +507 | 3,952 |
| 11 | multimodal-art-projection/YuE | Python | +500 | 7,606 |
| 12 | jiji262/douyin-downloader | Python | +473 | 11,288 |
| 13 | unclecode/crawl4ai | Python | +454 | 83,032 |
| 14 | pallets/flask | Python | +446 | 74,631 |
| 15 | melgarafael/DeskcommCRM | TypeScript | +444 | 2,074 |
| 16 | alibaba/open-code-review | Go | +438 | 23,068 |
| 17 | calesthio/OpenMontage | Python | +383 | 58,214 |
| 18 | petergyang/no-ai-slop | - | +381 | 9,020 |
| 19 | Lordog/dive-into-llms | Jupyter Notebook | +360 | 53,683 |
| 20 | microsoft/vscode | TypeScript | +359 | 192,353 |
| 21 | feder-cr/AIHawk | Python | +343 | 30,694 |
| 22 | rust-lang/rust | Rust | +327 | 118,706 |
| 23 | golang/go | Go | +317 | 138,699 |
| 24 | alphaXiv/OpenResearch | Rust | +304 | 1,893 |
| 25 | tensorflow/tensorflow | C++ | +303 | 199,961 |
写在最后
第一,通用 Agent 的红利期在榜单上结束了,垂直工种开始领票。第二,真正能上生产的项目都在做同一件事,把不该错的步骤从模型手里拿走。第三,灰色仓库可以换壳,空仓加远程脚本加关杀软这三件套还是那个味道,三查继续有效。
可执行的选型建议就一句,先定工种,再放 Agent。评审用带确定性管道的工具,渗透用带调用上限的编排器,研究用带 worktree 隔离的环境,销售用带审计的自托管。不要再给一个没有工牌的超级助手全公司的钥匙。

评论互动