VOL.2026.09.17 · 19 STORIES · AI NEW HOT DAILY
AI NEW HOT 日报
2026年9月17日 星期四 · 每日 08:00
覆盖 9月16日 08:00–9月17日 08:00(北京时间)
VOL.2026.09.17 · 19 STORIES · AI NEW HOT DAILY
2026年9月17日 星期四 · 每日 08:00
覆盖 9月16日 08:00–9月17日 08:00(北京时间)
Nous Research 在博客中记录了让 Hermes Agent 重构自身代码库的一次运行:主运行约 19 个有效小时,派出 1393 个子 Agent(峰值 218 个并行),将超百万行非测试 Python 代码削减 34.4%,模型花费约 1.93 万美元;人工估算成本为 15 万至 180 万美元。文章重点介绍了技能积累、编排者-工人树状分工、接口保真验证和故障恢复机制。重构后,文件规模、超长函数和长 if/elif 链明显减少,面向 Agent 的符号查找返回 token 从平均 2218 降至 993。
OpenAI 分享了一个用于跟踪、调查和披露模型错位问题的框架,并附有六份关于意外或令人担忧的模型行为的报告。
摘要指出,系统性能、基础设施高效扩展和持续软件优化是决定 AI 推理经济性的关键因素:更高系统性能意味着生成更多 token 并带来更高收入;高效扩展意味着吞吐量随硬件增加而成比例增长,能以更少资源服务大规模用户;持续优化意味着从基础设施投资中获得更多价值。
该转推解读称,Perplexity 以 CobbleDB 热存储、Pillar 持久状态层和 Lorry 批量投递层替换 DynamoDB,以解耦处理管道与在线热存储。文中给出的生产对比为:批量读 P50 从 31.4ms 降至 5.60ms,P99 从 123ms 降至 24.2ms;在约 20 万 rps 下运行,压测至 50 万 rps 未出现退化。成本估算称每档承诺折扣下至少便宜 20%。系统核心约 4 万行 Rust,由 2 名工程师和数百个 AI coding agents 在两个月内建成。
OpenAI 推出由 AI 驱动的新广告体验,包括 Sponsored Agents、面向营销人员的工具,以及与 HubSpot 和 Shopify 的集成。
该文来自 Browser Use 联合创始人 @gregpr07,回顾产品两年中围绕模型能力变化不断简化 Harness:从人工定义点击、输入等状态和动作,到让模型执行 JavaScript、直连 Chrome DevTools Protocol(CDP)自行决定观察方式。文中以 Hermes 智能体为例,称用单个 browser_exec 替换 12 个浏览器工具后,Opus 4.8 token 消耗下降 60%,Kimi K3 下降 66%,且两者均完成 18/18 次任务。作者由此提出复用 Pi、Codex、OpenCode 等经过验证的 agent 循环,并认为最小化 Harness、暴露最简底层接口的原则适用于浏览器、电脑、文本、音乐等智能体领域。
科学知识大多储存在静态论文中。一个名为 Paper2Agent 的自动化框架可将每篇论文转变为活跃的人工智能智能体——一个虚拟通讯作者,能够回答问题、将论文方法应用于新数据,并与其他论文智能体协作。这使得研究更易于复现、复用和扩展。
作者表示,Paper2Agent 系统使研究人员更容易复现论文并理解陌生领域的工作。
Claude Design、Claude Slides 和 Claude Docs 现已在 Claude Code 中可用。用户可以要求生成设计评审演示文稿或 UI 模型,并指向仓库中的实际文件与 RFC;可自行编辑或继续在对话中处理,并在完成后分享链接。也可在对话中用 Claude Docs 起草单页文档、用 Claude Slides 转为演示文稿、用 Claude Design 制作配套视觉稿。
从今天起,Claude Cowork 与聊天将合并为一个 Claude。该更新将首先向 Pro 和 Max 计划用户推出,在未来几周内通过 Claude 的网页版、桌面版和移动端应用覆盖现有用户和新用户。作者认为这意味着 Claude 正在成为通用智能体,并提到这与 OpenAI 几周前将 Codex 桌面应用更名为 ChatGPT 的做法相呼应。
在这期约65分钟的访谈中,Shopify CEO Tobi Lütke 认为多数企业把 AI 当作产出工具,而正确用法是将其变成培养判断力的环境。他介绍了 Shopify 内部名为 River 的 AI 员工、用多个子智能体组成 AI 理事会辅助决策的做法,也提出「slop grenades」等组织风险,并认为十年后最值钱的技能是品味与判断。
该内容转述了 @browser_use 联合创始人 @gregpr07 对 Browser Use 两年演进的总结:随着模型能力增强,应逐步移除人工定义的观察与动作接口,让模型直接使用 CDP 等底层浏览器接口。文中以 Hermes 智能体为例,称用单个 browser_exec 工具替换 12 个浏览器工具后,Opus 4.8 的 token 消耗下降 60%,Kimi K3 下降 66%,且均在任务运行中完成 18/18 次。作者将这一思路与 Rich Sutton 的 Bitter Lesson 联系起来,认为预定义状态和动作菜单从资产变为限制。原始正文为 null,信息主要来自标题与摘要。
从伯尼·桑德斯到史蒂夫·班农,华盛顿政治对立双方正共同要求对人工智能实施强力刹车。桑德斯希望对数据中心实施建设冻结,而OpenAI首次支持FRONTIER法案及其强制性外部安全审计。尽管特朗普持怀疑态度,两党对具有约束力的AI规则的压力仍在增长。
Google DeepMind 成立了 DeepMind Institute(DMI),一个专注于通用人工智能的跨学科研究平台。该研究所由 Demis Hassabis、Shane Legg 和 James Manyika 领导,重点关注安全、治理和控制风险,并汇集技术专家与艺术、人文、政策领域的研究者。
一项具有时代意义的数学声明引发了对人工智能工具如何为早期工作标注归属的质疑。
Anthropic 研究员 Jacob Coxon 的一条推文引发关于 AI 生存风险的激烈讨论;OpenAI 研究员 Daniel Selsam 警告“定时炸弹”,前 DeepMind 研究员称 AI 可能杀死所有人。一项针对 1500 多名顶尖 AI 研究人员的调查显示,受访者平均估计灭绝情境的概率为 18%。该数据来自 2024 年,且这一数字仍在上升。
开发了一种机器学习算法 PreGame,用于从单细胞 CITE 测序数据中识别肿瘤反应性 γδ T 细胞,并且该细胞群的扩增可用作治疗反应的生物标志物。
作者开发了Rider方法,将蛋白质语言建模与领域特异性结构验证相结合,在超过10,000个宏转录组中检测差异RNA病毒,包括长多蛋白和短片段。
企业数据湖中表的增长速度超过人工记录与分类能力,列描述缺失、治理标签未分配,这种文档债务影响数据发现、访问控制和合规。Glyph 是一个生产系统,将列描述生成和列类型标注这两个耦合问题建模为协作的 LLM 智能体,并以有状态图进行编排。其 Descriptor 会按需检索生成各列的流水线源代码,作为描述生成的依据。
AI NEW HOT · 基于已发布内容确定性整理 · 修订 1