Sites Sites Sites
OpenAI 在 X 上发布消息称,其约三个月前推出的 ChatGPT Sites 已让用户创建超过 500 万个站点,并近期上线了包括“一起构建”在内的若干更新。原文内容似乎被截断,未提供更多细节。
推荐理由:可帮助关注 ChatGPT 低代码建站能力的读者了解官方更新动态,但细节较少,适合快速追踪。
OpenAI 在 X 上发布消息称,其约三个月前推出的 ChatGPT Sites 已让用户创建超过 500 万个站点,并近期上线了包括“一起构建”在内的若干更新。原文内容似乎被截断,未提供更多细节。
推荐理由:可帮助关注 ChatGPT 低代码建站能力的读者了解官方更新动态,但细节较少,适合快速追踪。
GPT-6 Astra 挑战赛已在 Product Hunt 开放提交。参与者需使用 Astra 构建项目并在 9 月 17 日前提交,9 月 18 日在 Product Hunt 上线。OpenAI 与 @OpenAIDevs 合作举办该挑战赛,前五名发布项目各获得 1 万美元 OpenAI API 额度,以及最多两名团队成员一年的 ChatGPT Pro。原文在“如果你已经在使用 Astra 构建”处截断。
推荐理由:适合关注 OpenAI 开发者生态与 Product Hunt 发布机会的读者快速了解该挑战赛的时间、参与方式和奖励。
该来源摘要介绍了一篇 Meta 论文:Auto-RecSys 可在 Meta 的工业级推荐模型上开展自主研究,单次训练可能耗时数天。系统在服务器间并行运行实验,并通过共享记忆使工作可在故障或新会话后继续;将指导分为自然语言技能文件用于推理,以及确定性脚本用于操作性任务。两个循环让其持续改进:模型专属 playbook 记录失败尝试并保留可运行流程;实验结果反馈下一轮思路。随着 playbook 成熟,每次迭代的 major fixes 从 4.0 降至 1.3,失败也落入可重复类别。文中附有论文链接与 Chat with Paper 链接。
推荐理由:该内容为 Meta 论文的摘要,说明 Auto-RecSys 如何并行执行工业级推荐模型实验,并用共享记忆与技能文件提升稳定性。对关注推荐系统、自主智能体与研究自动化的读者有参考价值。
Anthropic 的新威胁情报报告记录了 Claude 被滥用八个月的情况:阿里 Qwen 团队、DeepSeek 和 Moonshot AI 等中国 AI 实验室大规模中转请求或提取训练数据,其中仅 Qwen 就涉及超过 1.51 亿次交互;还有行为者利用 Claude 开发导弹软件、自主自杀式无人机和全国性监控系统。
推荐理由:该报道基于 Anthropic 威胁情报,揭示 AI 模型被滥用于武器与监控,以及被中国实验室用于训练数据提取的具体规模,适合关注 AI 安全与治理的读者。
据原文摘要,YuE2-3B 能够通过可编辑乐谱将歌词生成为完整歌曲。它先生成旋律与和弦,再生成人声和伴奏;用户可编辑乐谱或提供自己的 ABC 记谱。同一检查点支持直接歌曲生成、零样本翻唱,以及对乐谱、风格和歌词的智能体引导编辑。摘要还称,YuE2 best-of-8 在 WildSongBench 的 SongBench Avg 上得到 6.9632,高于所评估的开源和闭源系统;Suno v5 为 6.8721。该模型可在 24GB GPU 上本地生成 48 kHz 立体声音频而无需量化。权重采用 CC BY-NC 4.0,代码采用 Apache 2.0。
推荐理由:该内容提供了可编辑乐谱式音乐生成模型的能力、基准测试对比和本地运行条件,适合关注开源音乐生成与模型落地条件的读者快速判断是否值得尝试。
中央网信办、农业农村部、工业和信息化部联合印发《数字乡村高质量发展行动计划(2026—2030年)》,提出扩大农村数字消费,支持新能源汽车、绿色智能家电下乡,鼓励企业研发符合农村生活需要的智能软硬件产品;推动人工智能与乡村教育深度融合,鼓励有条件的乡村学校部署智能教育终端和教育智能体;推进数字赋能乡村治理,并依法打击农村电信网络诈骗、网络赌博、非法金融活动等违法犯罪行为。
推荐理由:适合关注数字乡村、农村数字消费和涉农智能软硬件政策的读者快速了解三部门最新行动计划要点。
工信部在9月11日新闻发布会上介绍,“十四五”期间我国智能网联新能源汽车产业取得显著成效:2020至2025年新能源汽车年销量从136.7万辆增至1649万辆,年均复合增长率65%;国内乘用车组合驾驶辅助功能搭载率从16.2%提升至64.9%;新能源汽车、动力电池及关键材料产量占全球70%以上。工信部还指出保护主义抬头、非理性竞争、质量和自动驾驶安全等问题,并已联合编制《智能网联新能源汽车产业发展“十五五”规划》,围绕绿色化、智能化、高端化、国际化推动产业高质量发展。
推荐理由:提供工信部权威数据与“十五五”规划方向,有助于读者了解中国智能网联新能源汽车产业规模、政策重点和潜在挑战。
OpenAI 发布 Agents API 公开测试版,开发者可构建自主运行数小时、执行代码并将任务转交子代理的云端代理;除 token 用量外无额外费用。Cloudflare、Vercel 和 Oracle 提供额外沙盒环境。
推荐理由:适合关注 AI 开发工具和自动化代理的读者了解 OpenAI 最新 API 能力、计费方式及可用沙盒生态。
按需扩展智能体。这几乎就是 ChatGPT Work 底层运行的基础设施,全部封装进一个 API,可在不到 1 分钟内上手。文中引述 Steve 称:OpenAI 今天推出 Agents API,这是一种在云端构建智能体的全新方式,由 Codex harness 提供支持;可接入你喜欢的工具和连接器,连接任意沙盒,让 Astra 来处理。文末附 OpenAI 官方介绍链接。
推荐理由:适合关注 OpenAI 智能体产品与云基础设施的读者快速了解 Agents API 的定位、关键支撑和入门方式;但内容来自社交转发,细节和准确性应以 OpenAI 官方发布为准。
OpenAI 推出 Agents API 公开测试版,让开发者通过一次 API 调用创建由 OpenAI 托管运行、可在云端连续工作数天的生产级 Agent。该 API 将编排、长会话和上下文管理交给 OpenAI,开发者只需定义 Agent 的差异化能力;沙箱环境支持自带、合作伙伴和 OpenAI 托管三种选择,并提供长会话续航、大规模工具使用和子 Agent 并行等能力。
推荐理由:适合关注 OpenAI 生态和 AI Agent 开发的读者快速了解 Agents API 的核心定位、沙箱解耦设计以及 Harness 关键能力,可用于评估是否将其纳入开发方案。
Shopify 曾在 2020 年全面采用 React Native,现在借助 AI Coding 转向原生开发。团队通过 Helix 系统将迁移拆分为可审查的小检查点,并将业务逻辑与 UI 解耦,让 Agent 能快速迭代;全原生 Shop 应用从概念验证到上架用了约 12 周。该决定还对 FlashList、React Native Skia 和 Restyle 等 React Native 生态项目带来后续影响。
推荐理由:文章结合 Shopify 的工程实践,展示了 AI 编程如何改变原生与跨平台开发成本的计算,并介绍了兼顾自动化与人工审查的迁移流程,对移动端架构和 AI 辅助开发决策有参考价值。
据 Rohan Paul 转述,Foundation Models 研究所(IFM)发布 K2 Horizon 系列,共 6 个开源 AI 模型,覆盖从 0.9B 设备端小模型到 375B 大模型,面向推理、编程和 AI 智能体。所有模型均公开权重、训练代码、配置、数据或数据配方、中间检查点、训练日志和评估,涵盖从预训练到推理与智能体训练的过程。0.9B、3.7B 和 7B 模型在同尺寸类别中达到新水平;稀疏的 36B-A4B 采用 Mixture-of-Value Attention 架构,每次激活约 4B 参数,接近稠密 32B。每个模型在约 20T token 上训练,IFM 还发布 xLLM 训练基础设施及完整智能体后训练代码库,包括 RL 流程。
推荐理由:适合关注开源模型权重、训练透明度和推理/智能体训练流程的读者,可获取从预训练到后训练的代码、数据配方、检查点与日志等较完整记录。
Apple 机器学习研究介绍了 SimpleDesign,一种联合建模蛋白质氨基酸序列与三维结构的生成模型。该方法旨在突破现有模型通常先训练自编码器、再训练生成模型的多阶段流程限制,面向药物发现和蛋白质工程等需要理解序列与结构多模态关系的任务。
推荐理由:适合关注蛋白质生成模型、序列-结构联合建模和药物发现的研究者与工程师,可了解 Apple 在简化蛋白质设计流程方面的最新方法。
手语处理系统传统上在句子层面运行,忽略了对手语理解至关重要的语篇现象。我们提出 DiscoSign,这是一种基于语言学研究、具备语篇感知的文本到手语注释翻译计算方法。该方法在模块化大语言模型(LLM)翻译框架中处理三个关键现象:(i)空间共指消解,让实体在语篇中保持空间位置一致;(ii)问答从句(QACs),即伪分裂结构……
推荐理由:该研究将语篇现象引入手语注释翻译,适合关注手语计算、大语言模型翻译与语言学交叉的读者了解模块化 LLM 框架如何建模空间共指与问答从句。
OpenAI 已在 API 中发布 GPT-Live-1。Brooke Hopkins 与负责实时 API 的 Peter Bakkum 进行对话。该模型不再串联语音识别、语言模型和语音合成,而是对输入输出音频进行连续推理,采用更少轮次感的交互模式,并支持将复杂推理与工具调用委托给后端模型,包括第三方模型。开发者可通过系统提示调整语气、节奏和对话风格;更长会话的上下文保持更好,全双工电话支持也有望用于客服、订位和日程安排等场景。
推荐理由:该内容结合开发者一线测试与访谈,解释 GPT-Live-1 相比级联语音架构的变化,适合关注语音智能体、实时 API 和电话自动化落地的读者了解设计取舍与实际影响。
Shopify 正从 React Native 迁回 Swift 与 Kotlin 原生代码库。官方解释,2020 年转向 React Native 是为了避免重复开发、让开发者跨栈工作并减少追平功能差异的成本;现在 AI 智能体已能承担实现、翻译、测试和审查工作,使双平台原生维护成本不再是决定因素。Shopify 曾维护 react-native-skia、flash-list 和 restyle,前两项将找到新归宿,restyle 将在 2026 年底归档。
推荐理由:该案例提供了一个具体信号:AI 编码代理正在改变跨平台与原生技术选型的成本计算,适合移动开发者和技术决策者参考。
谷歌 Gemini 应用现已推出 Windows 版本。用户可通过 Alt + Space 快捷键润色草稿、总结长文档、头脑风暴,并在常用工具和应用旁创建自定义图片和视频。获取地址:https://gemini.google/desktop。
推荐理由:为 Windows 用户提供 Gemini 桌面端的官方入口和快捷键用法,便于快速了解如何将其融入日常工作流。
MMLU-Pro作者与TIGER Lab、UBC NAIL、UniPat AI、CMU共同推出ClawBench,在144个真实生产网站和153项日常在线任务上评估AI智能体。与使用沙盒或少量虚拟机应用的旧基准不同,ClawBench无沙盒、无静态页面,智能体需像人一样处理认证、动态内容、弹窗和真实UI复杂度。结果显示,最强模型Claude Sonnet 4.6成功率仅33%,三分之二任务失败;GPT-5.4仅完成10/153项,成功率为6.5%;68项任务无任何模型完成。研究认为当前基准掩盖了从“能用浏览器”到“能真正完成工作”的巨大差距。
推荐理由:该研究暴露了现有网页智能体基准的局限,为关注AI智能体实际落地、评测方法和模型能力边界的读者提供重要参考。
Tau3 测试语音代理在航空、零售、电信等客服场景中完成任务的能力。GPT-Live-1 搭配中等推理的 GPT-6 Astra 时,首次尝试完成 83.6% 的任务,而 GPT-Realtime-2.1 为 45.7%;在 TauBanking 中得分为 38.1%。在对话交互方面,GPT-Live-1 在 Artificial Analysis 的 Conversational Dynamics 基准上得 97.3%,在 Full Duplex Bench v1.5 的交互性上得 80.1%;在 Full Duplex Bench v1 中用户在话轮结束后的响应等待为 0.798 秒,而 GPT-Realtime-2.1 为 1.41 秒。工具调用方面,在 Full Duplex Bench v3 中正确工具调用序列为 87%,响应质量评分 90%。详见发布博客。
推荐理由:该推文提供了 GPT-Live-1 在客服任务完成率、对话节奏和工具调用上的量化对比,便于开发者判断其相比 GPT-Realtime-2.1 的适用性与差异。
OpenAI 宣布推出面向金融服务的 ChatGPT Work 体验,结合内置金融数据与 GPT-6 Astra 的推理能力,团队可用于研究、构建金融模型和制作定制客户材料。
推荐理由:适合关注金融行业 AI 应用的读者了解 OpenAI 针对金融服务场景的新产品方向与功能边界。