GitHub 趋势洞察 2026-09-14,垂直 Agent 分科,评审渗透研究和销售同一天抢席

发布于 · 3,030 字 · 约 8 分钟#Github Trending#Agents
GitHub 趋势洞察 2026-09-14,垂直 Agent 分科,评审渗透研究和销售同一天抢席 封面图
  • 垂直 Agent 按工种分科,评审、渗透、研究、销售同一天挤上榜
  • 阿里 open-code-review 用确定性管道加 Agent,token 消耗约等于通用 Agent 的九分之一
  • PentAGI 把渗透拆成研究、开发、执行三岗,硬限制工具调用次数
  • Claude-Red 用 78 个 skill 覆盖 23 类攻击面,OpenResearch 用 git worktree 隔离并行研究
  • Optimizer-Toolkit 空仓加远程脚本仍占第三,灰色手法没有退

2026 年 9 月 14 日 · 本期共收录 25 个热门开源项目

今日焦点,技能栈有了工种

gods-eye-view 继续坐庄,+2,898 领跑,总星 31,293。VoiceStudio 昨天还在深挖名单里,今天直接 +2,546 把自己推到亚军,总星 25,976。讲真,这两个项目已经不需要再介绍一遍,一个把真卫星数据喂进浏览器,一个把 ElevenLabs 搬进本地硬盘,长跑和本地语音各自有各自的观众。

我更想看后面那排新面孔。

第 16 位的阿里 open-code-review 把两年内审工具开了源,第 7 位的 PentAGI 把渗透测试拆成研究、开发、执行三岗,第 10 位的 Claude-Red 塞进 78 个进攻技能,第 24 位的 OpenResearch 让研究 Agent 一人一棵 git worktree,第 15 位的 DeskcommCRM 把销售操作系统自托管。昨天技能栈刚成型,今天这些技能开始按工种领工牌。

这不是又一个写代码的日子。

灰色那边也没走。第 3 位的 Optimizer-Toolkit 仍然是空仓加远程脚本加关杀软,+1,089,总星 3,770,两个 commit,两个 watcher。排名比昨天那批灰色仓库还靠前。

榜单前五深度解读

1. alibaba/open-code-review · Go · +438 · 23,068

阿里巴巴集团内部用了两年的官方 AI 代码评审助手,服务过数万开发者,标称检出过百万量级缺陷,今天以 Apache-2.0 开源。npm 包名 @alibaba-group/open-code-review,命令是 ocr,要求 Git 2.41 以上。

它要解决的不是模型会不会看代码,是纯语言驱动的评审会漏文件,评论钉错行,提示词一改质量就漂。仓库把根因写得很硬,必须做对的步骤由工程逻辑保证,不交给模型发挥。确定性管道负责选文件、按关联打包、给每个包开隔离上下文的子 Agent、用模板匹配规则、把评论钉到精确行号再做质量回查。模型只在需要判断的地方出场,可以打开完整文件、搜仓库、看兄弟 diff,不局限于当前 hunk。内置规则覆盖空指针、线程安全、XSS、SQL 注入,端点兼容 OpenAI 和 Anthropic。

基准叫 AACR-Bench,50 个热门仓库,200 个真实 PR,10 种语言,1,505 个由 80 多名资深工程师标注的问题。同一模型下,对比通用 Agent(Claude Code),精确率和 F1 显著更高,token 大约只花九分之一,墙钟时间也更短。召回率更低,这是刻意的,宁可少报,也不要一堆误报。坦白讲,两年坑写成管道再塞模型,这种开源我买账。

2. vxcontrol/pentagi · Go · +613 · 23,783

全自主渗透测试 Agent 系统,MIT 协议,Go 后端加 React 前端加 GraphQL,数据落在 PostgreSQL 和 pgvector。界面默认绑在本机 8443 的 HTTPS。它不是 CALDERA 那种预置剧本库,用户用自然语言给范围和目标,编排器从向量库里捞相似案例,再按岗派活。

三岗分得很清楚。研究员做目标分析和已知问题检索,开发者根据库存技战法和工具能力做攻击计划,执行者在沙箱里跑计划并落盘。数据模型是 Flow 到 Task 到 SubTask 到 Action,记忆分长期、工作、情节三层,膨胀的对话会按 ChainAST 做链式摘要,工具调用结构还在。监督不是靠人盯着,硬限制一直开着,通用 Agent 默认 100 次工具调用,搜索类默认 20 次,连续 3 次发不出合法工具就由反射器往 done 或 ask 上赶。执行监视器默认关,打开后在 Qwen3.5-27B-FP8 上质量大约翻倍,时间和 token 大约两到三倍。

沙箱走独立 Docker 网络,生产建议两节点,不信任的执行放专用 worker。推荐 TLS 加固的 Docker-in-Docker,明确劝你别把宿主机 Docker 套接字挂进去。工具二十多种,nmap、Metasploit、sqlmap 都在。本地生产路径写过一组数字,vLLM 跑 Qwen3.5-27B-FP8,4 张 RTX 5090 上提示约 13k TPS、补全约 650 TPS,能并发 12 个以上 Flow。你想想看,渗透 Agent 真正难的不是会不会用 nmap,是谁来限制它别在循环里把自己烧穿。

3. SnailSploit/Claude-Red · Python · +507 · 3,952

给 Claude Skills 系统准备的进攻安全技能库,MIT 协议,78 个技能,23 个类别,路线图写到大约 130 个。安装方式是克隆进 ~/.claude/skills/claude-red,对话触发匹配才加载,用不到的类别不进上下文。也可以按目录稀疏克隆,或用 install.sh --category 只装一类。

覆盖面按攻击面拆开,Web 16 个从 SQLi 到请求走私,无线 14 个从 802.11 到 LoRaWAN,利用开发 6 个,红队基础 7 个,还有云、移动、容器、CI/CD、供应链、社会工程,外加一个专门打提示注入、越狱和 RAG 投毒的 AI 类。每个技能是一份结构化的 SKILL.md,不是一段随手 prompt。作者写过一句定位,给对技能,Claude 就不再是聊天机器人,它变成操作员。

老实讲,昨天 i-have-adhd 证明 Skill 能当安装包,今天 Claude-Red 证明安装包能按攻击面拆 SKU。授权红队、漏洞赏金、CTF 备课是它自己划的使用边界,这个边界写在仓库里,不写在星数里。

4. alphaXiv/OpenResearch · Rust · +304 · 1,893

用任意模型跑并行研究 Agent 的本地环境,Rust 二进制,命令是 orx,默认只绑 127.0.0.1:4791,状态放 SQLite,MIT 协议。总星才 1,893,fork 139,在这张榜上几乎是最小的正经仓库,也是最清楚的研究工种样本。

核心设计是一人一条线。每个研究方向单独开会话,单独一棵 git worktree,Agent 之间不共享脏树。实验图记录父子谱系,自动研究可以循环,提出改动、改代码、拉起一次 run、看日志,再决定下一轮。同一份提交快照能在笔记本、SSH 远端、Slurm、Kubernetes、Ray、Hugging Face Jobs、Modal 上跑。Agent 后端接 Claude Code、Codex、OpenCode、Cursor,技能用 orx install-skills 装。

其实吧,研究 Agent 最容易把探索、实验和证据搅在同一段聊天里。OpenResearch 做的事很土,把这三样用 worktree 和实验图切开。创建项目和 run 默认不上云,账号只为组织和托管算力服务。本地优先在这里能核对,默认只绑环回地址。

5. melgarafael/DeskcommCRM · TypeScript · +444 · 2,074

开源的 AI 销售操作系统,自托管 CRM,原生 Agent 加 WhatsApp,对着 Kommo、Octadesk、Intercom 这些按月收费的聊天销售套件。Next.js 16、React 19、TypeScript 6,数据在 Supabase Postgres,RLS 加 vector 做 RAG,聊天走 WAHA Plus 或 Meta Cloud API。HTTP 规范路径下有 196 个路由处理器,文档 157 篇,提交 4,016 次,推荐 4 GB 内存。

Agent 不是装饰,按租户做 RAG,技能可执行,组织记忆在,情绪识别在,AI 到人的交接留审计,AI 本身是一等公民的负责人,还有花费上限。自动化是 WHEN/IF/THEN,每分钟被 cron 抽干。多租户加 LGPD,CI 里有跨两个组织的隔离门,审计日志只追加,留 5 年。Playwright 规格 48 过 49。我一直觉得销售这条线被 coding Agent 的声量压太久了,一个能在 WhatsApp 上值守、打分、推漏斗的自托管系统,这更像 Agent 出圈的现场,IDE 插件已经看够了。

趋势分析

工牌比框架先到

今天榜上真正多出来的,不是又一个通用 Agent 框架。open-code-review 是评审岗,PentAGI 是渗透岗,Claude-Red 是进攻技能岗,OpenResearch 是研究岗,DeskcommCRM 是销售岗,YuE2 甚至把音乐编辑做成可检查的乐谱计划。同一天五条垂直线挤上榜,说明市场在用岗位投票,不再用「Agent」这个空词投票。

怎么说呢,技能栈解决的是怎么分发,工种解决的是分发给谁。昨天的安装包今天开始印工牌。

确定性管道把 Agent 拴住

五条垂直线有一个共同动作,先把不该错的步骤从模型手里拿走。评审用确定性管道选文件钉行号,渗透用 100/20 的工具调用上限和反射器收口,研究用 git worktree 隔离脏树,销售用 RLS 和只追加的审计。自由发挥留在判断层,执行层全部工程化。

Agent 越能干,越需要被拴住。

这和去年把一切丢进一个超级 Agent 的思路正好反过来。大厂用两年生产数据证明,九分之一的 token 加更高精确率,换来的是噪声更少,不是能力更弱。

第三席还是空仓

Optimizer-Toolkit 无语言,无源码,README 指向 true-soft.su 的远程 PowerShell,安装指引里有绕过执行策略和关掉 Defender。两个 commit 对 3,770 星,两个 watcher。手法和本专栏点名过的那批完全同一套,空仓库、站外加载器、关杀软、SEO 关键词农场。

说真的,灰色仓库的数量可以回落,位置却可以更靠前。平台过滤跟不上换壳,读者只能继续用三查,有没有真源码,安装是不是远程脚本,要不要你关杀软。三条挡得住绝大多数坑,点名挡不住换马甲。

值得关注的潜力项目

multimodal-art-projection/YuE · Python · +500 · 7,606

YuE2 把写歌拆成可检查的符号计划。架构是自回归加非自回归的 Mixture-of-Transformers 先出乐谱和语义 token,再 flow matching 填声学潜变量,VAE 解成 48 kHz 立体声,中间没有量化。检查点 YuE2-3B,需要 24 GB 显存。零样本翻唱靠 SheetSage2 把录音转成 ABC,948 首作品上,带完整乐谱的 CLEWS mAP 是 0.647,关掉乐谱只剩 0.006。WildSongBench 192 条提示、17 个系统里,YuE2 八选一均值 6.9632,略高于 Mureka 9 的 6.9377 和 Suno v5 的 6.8721。音乐编辑也走 Agent,改 ABC 再整曲重录,演示里一首歌走过 9 步 14 个版本。分科分到作曲这一行有点超纲,但方向是真的。

feder-cr/AIHawk · Python · +343 · 30,694

隐身 Firefox 上的浏览器 Agent,宣传点是不被反爬标记、不触发验证码。任务用白话下,计算机使用 Agent 加浏览器 MCP,对接 Claude Code 和 Gemini CLI。总星已经 30,694,今天的增量不算暴,但它把「眼睛」这条工种补在 PentAGI 的执行器和 DeskcommCRM 的聊天管道旁边。Agent 要出圈,总得有一双不被网站当场踢走的手。

完整榜单

排名仓库语言今日新增总 Stars
1bilawalsidhu/gods-eye-viewJavaScript+2,89831,293
2debpalash/VoiceStudioPython+2,54625,976
3ScalarLinkAxe/Optimizer-Toolkit-+1,0893,770
4google/artemisPython+7914,367
5asgeirtj/system_prompts_leaksJavaScript+72765,831
6JustVugg/colibriC+65229,236
7vxcontrol/pentagiGo+61323,783
8tonhowtf/omnigetRust+54711,334
9Panniantong/Agent-ReachPython+53180,242
10SnailSploit/Claude-RedPython+5073,952
11multimodal-art-projection/YuEPython+5007,606
12jiji262/douyin-downloaderPython+47311,288
13unclecode/crawl4aiPython+45483,032
14pallets/flaskPython+44674,631
15melgarafael/DeskcommCRMTypeScript+4442,074
16alibaba/open-code-reviewGo+43823,068
17calesthio/OpenMontagePython+38358,214
18petergyang/no-ai-slop-+3819,020
19Lordog/dive-into-llmsJupyter Notebook+36053,683
20microsoft/vscodeTypeScript+359192,353
21feder-cr/AIHawkPython+34330,694
22rust-lang/rustRust+327118,706
23golang/goGo+317138,699
24alphaXiv/OpenResearchRust+3041,893
25tensorflow/tensorflowC+++303199,961

写在最后

第一,通用 Agent 的红利期在榜单上结束了,垂直工种开始领票。第二,真正能上生产的项目都在做同一件事,把不该错的步骤从模型手里拿走。第三,灰色仓库可以换壳,空仓加远程脚本加关杀软这三件套还是那个味道,三查继续有效。

可执行的选型建议就一句,先定工种,再放 Agent。评审用带确定性管道的工具,渗透用带调用上限的编排器,研究用带 worktree 隔离的环境,销售用带审计的自托管。不要再给一个没有工牌的超级助手全公司的钥匙。

评论互动

© 2026 王若风的技术博客 · Powered by Astro