AI Builders Digest 0910:Devin 破解 RSA-260 刷新纪录,DeepSeek V4.1-Flash 直击 KV cache,Paul 重返 OpenAI
- Cognition 工程师 samyok 率队驱动多个 Devin 智能体构建高性能 GPU 格子筛,完成 260 位 RSA-260 因式分解,刷新 2020 年 RSA-250 保持的公开 RSA 挑战纪录:人定义目标,agent 造工具跑数论
- DeepSeek 开源 V4.1-Flash:552B MoE(prefill 8B/decode 16B 激活)、原生视觉、1M 上下文,KV cache 仅为 V4 Flash 的 1/4,MIT 许可并 Day 0 上线硅基流动,直击 agent 长会话的内存成本
- Sam Altman 欢迎安全研究重将 Paul 回归 OpenAI(3349 赞);Thibault 确认部分 banked reset 未生效的问题已为受影响用户补齐(9117 赞)
- Claude Marketplace 上新 CrowdStrike、Cursor、Factory、Gamma、Vercel,企业可用 Anthropic 支出承诺采购,云厂商 committed-spend 打法进入 agent 生态(2858 赞)
- 经济叙事攻防:Shipper 指出 Anthropic 经济报告的两个关键假设将显著改变结论,Levie 给出调和框架——扩散远比人们想的慢;Rauch 总结半年 8 次降价与 16 项模型折扣
今天的 AI Builders Digest 主线是 agent 基础设施的供给侧总动员:Cognition 的工程师驱动多个 Devin 构建高性能 GPU 格子筛,完成 260 位 RSA-260 因式分解,把公开纪录从 2020 年的 RSA-250 直接推进十年;DeepSeek 开源 V4.1-Flash,把 agent 长会话最痛的 KV cache 内存压到上一代的 1/4,1M 上下文、Day 0 上线硅基流动;Claude Marketplace 打通企业支出承诺。人事侧,Sam Altman 欢迎安全重将 Paul 回归 OpenAI(3349 赞)。
今日总结
主线:纪录、内存与承诺。
Devin 把 RSA 挑战推进到 260 位。 Cognition 员工 samyok 率团队驱动多个 Devin 智能体构建高性能 GPU 格子筛,完成 260 位 RSA-260 的因式分解,刷新了自 2020 年 2 月 RSA-250 起无人撼动的公开纪录。值得注意的不是算力本身,而是编排:人定义目标与验收,agent 设计并搭建数论计算的基础设施。上周还在吵「谁证明了几何难题」,这周 agent 已经把密码学的公开锚点拔了。
DeepSeek 直接攻击 agent 的内存账单。 V4.1-Flash 的参数组合拳:552B MoE、prefill 约 8B/decode 约 16B 激活、原生视觉、1M 上下文,KV cache 占用约为 V4 Flash 的 1/4,MIT 许可开源。agent 会话越长、上下文越贵,KV cache 就是那个悄悄吃掉预算的项;把这项成本砍掉四分之三,等于把长程 agent 的经济模型重写了一遍。
企业采购的聚合入口开张。 Claude Marketplace 上新 CrowdStrike、Cursor、Factory、Gamma、Vercel,企业可以用 Anthropic 支出承诺直接购买这些 Claude 生态产品(2858 赞)。云厂商的 committed-spend 打法正式进入 agent 生态:预算在哪,分发就在哪。
经济叙事的攻防。 Shipper 对 Anthropic 经济情景报告提出两点关键假设(189 赞):设计良好,但改变这两个假设,分析结论会显著不同。Levie 给出调和框架(205 赞):AI 的能力与 GDP 影响之间的错位,答案是扩散远比人们想的慢,且会以意想不到的方式呈现。模型的可调参沙盘上线第一天,假设之争就开始了。
今日关键词: RSA-260 · KV cache · Marketplace · Paul 回归
官方博客
AI Hot:Devin 智能体完成 RSA-260 因式分解,刷新公开纪录
AI Hot·2026-09-10 18:50 CST·原文链接
Cognition 员工 samyok 率团队驱动多个 Devin 智能体构建高性能 GPU 格子筛,对 260 位的 RSA-260 完成因式分解,刷新此前由 RSA-250(2020 年 2 月)保持的公开 RSA 挑战纪录。
RSA 挑战是密码学的公开锚点:上一次纪录刷新还是六年前、由人类专家团队完成。这次的分工值得存档——人定义目标,agent 造工具、跑数论。纳维-斯托克斯的署名之争还在进行,RSA-260 又添一例:AI 时代的计算纪录,评议规则都得重写。
AI Hot:DeepSeek V4.1-Flash,KV cache 降到上一代的四分之一
AI Hot·2026-09-10 20:40 CST·原文链接
DeepSeek 发布多模态模型 V4.1-Flash,以 MIT 许可在 Hugging Face 开源,目标直指 KV cache 与长上下文处理成本的大幅压缩。
开源阵营的竞争焦点完成了转移:去年比「能力追平」,本周 GLM 比价格、Qwen 比本地、DeepSeek 直接改写长会话的成本结构。agent 时代最贵的不是首次推理,是第 100 次交互时还在缓存里的那 99 万 token。
AI Hot:V4.1-Flash Day 0 上线硅基流动,552B MoE 支持 1M 上下文
AI Hot·2026-09-10 22:21 CST·原文链接
硅基流动宣布 DeepSeek-V4.1-Flash 于 Day 0 上线其平台。规格书全貌:
- 552B MoE,prefill 约 8B 激活、decode 约 16B 激活
- 原生视觉,1M 上下文窗口
- KV cache 占用约为 V4 Flash 的 1/4
- MIT 许可证
Day 0 可用意味着「开源即服务」的窗口期竞争进入小时级。配合上周 DeepSeek 多模态开源的节奏,国产开源阵营完成了一周双更。
X/Twitter 动态
Sam Altman(OpenAI CEO):欢迎 Paul 回归,服务优先
Sam Altman(sama)·2026-09-09 22:38 CST·原文链接1·原文链接2
两条。人事(3349 赞):欢迎 Paul,感谢你为 AI 安全所做的一切,「期待再次共事」——安全研究重将回归 OpenAI,放在误对齐披露框架改革的当口,信号意义大于职务本身。承诺(7017 赞):如果那样会很糟糕,但我们会优先保障客户的服务质量,直到重新回到正轨。配文语境未明,但「服务优先」的姿态与上周的发布危机一脉相承。
Thibault Sottiaux(OpenAI Codex/ChatGPT):重置未生效已修复
Thibault Sottiaux(thsottiaux)·2026-09-10 02:23 CST·原文链接1·原文链接2
运营收尾(9117 赞):早间部分 banked reset 在 ChatGPT Work 与 Codex 中未完全生效,受影响时间窗的用户已全部补齐。士气(5776 赞):很高兴和大家一起在这里建造,有太多可探索的。花絮(2971 赞):与研究员争论新模型命名是最大乐趣之一,他们的提案总是最搞笑的。发布周的余震与日常,都在这三条里。
Claude(Anthropic 官方):Marketplace 上新,支出承诺打通
Anthropic(claudeai)·2026-09-10 00:09 CST·原文链接
Claude Marketplace 新成员(2858 赞):CrowdStrike、Cursor、Factory、Gamma、Vercel。企业现在可以用 Anthropic 支出承诺购买更多 Claude 生态产品。当 Cursor 都进了 Claude 的货架,编辑器战争的边界开始模糊:竞争与合作将在同一张采购单上并存。
Dan Shipper(Every CEO):Anthropic 经济报告的两个关键假设
Dan Shipper(danshipper)·2026-09-10 02:47 CST·原文链接
对昨天 Anthropic 经济情景模型的批评性阅读(189 赞):这是一份设计精良的报告,但其中两个重要假设一旦调整,分析结论会显著不同。情景模型的价值不在结论,而在暴露假设;第一天就被专业读者拆出关键参数,恰恰说明开放沙盘的决策——争论透明地发生了。
Aaron Levie(Box CEO):扩散比想象的慢,coding agent 比想象的广
Aaron Levie(levie)·2026-09-10 01:26 CST·原文链接1·原文链接2
两条互补判断。宏观(205 赞):调和 AI 能力与 GDP 影响的错位,答案是扩散远比人们想的慢,且会以意想不到的方式呈现。微观(70 赞):coding agent 的用途将远超所有人此前的想象,会出现全新的工具品类。宏观慢、微观快,这两条同时为真的世界,正是企业现在最困惑的地方。
Guillermo Rauch(Vercel CEO):半年八次降价与基准活动
Guillermo Rauch(rauchg)·2026-09-10 07:11 CST·原文链接1·原文链接2
价格侧的半年总结(211 赞):过去 6 个月,8 次降价/费用减免/结构优化,外加 16 项模型折扣,还有更多在路上。活动侧(183 赞):与 Benchmark 合办 AI Benchmarks,调侃这是「旧金山史上名字最贴切的活动」。在跑分信任危机的一周办基准峰会,时机本身就是观点。
Peter Steinberger(独立开发者):OpenClaw 的仪表盘与云会话
Peter Steinberger(steipete)·2026-09-10 10:51 CST·原文链接1·原文链接2
OpenClaw 的进化两则:Dashboards/Mini-Apps 两个月前还是他的提议,如今已替换掉大量围绕 OC 自建的定制工具,「一切都是侧栏条目、仪表盘或页面」(161 赞);云会话终于快了——Remote Terminal、WebVNC 与 computer use 的 CUA(25 赞)。另有一条「This is brilliant」(1153 赞)的转发喝彩。harness 战争的另一个战场是自用工具的产品化速度。
Zara Zhang(独立开发者):想法易得,信念难求
Zara Zhang(zarazhangrui)·2026-09-09 16:15 CST·原文链接
一句话格言(114 赞):Idea is easy, conviction is hard。接上周「建什么成为瓶颈」的讨论:想法的供给在 agent 时代近乎无限,稀缺的是押注一个想法并扛住证伪期的信念。执行贬值之后,信念成了第三种被重估的资产。
Peter Yang:用新模型照自己的盲点
Peter Yang(petergyang)·2026-09-10 00:50 CST·原文链接
一个实用 prompt(95 赞):测试新模型思考能力的最爱方式,是让它对你阻碍自己进步的盲点给出残酷而诚实的反馈,把相关上下文直接贴给它。模型评测的最小单位不是基准题,是它对你的理解有多准。
数据采集时间:2026-09-10 23:26 CST

评论互动