跳到主要内容
AI News Hub北京时间
Topic · 主题全部主题 →

评测基准

关注模型成绩、评测方法与排行榜变化。

4 条精选

● 持续更新

  1. @ArtificialAnlys✦ 精选
    AI 评分 80/100

    OpenAI GPT-Live-1 以 81.5 分登顶 Artificial Analysis 语音到语音指数,Astra 为委派后端模型

    OpenAI 新的全双工语音到语音模型 GPT-Live-1 在 Artificial Analysis 语音到语音指数中首次亮相,使用 Astra 作为委派后端模型时得分 81.5,排名第 1;使用 Sol 低推理配置时得分 80.1,排名第 3。在 Speech Agent Arena 中,Gemini 3.1 Flash Live Minimal 以 1,096 Elo 领先偏好,Grok Voice Think Fast 2.0 High 以 94.6% 的任务成功率领先;GPT-Live-1 两种配置分别排名第 3 和第 4。Tau Voice 智能体性能基准中,GPT-Live-1 的两种配置位列前二。Big Bench Audio 音频推理中,GPT-Live-1 Astra 中等推理得 90.1%,Sol 低推理得 89.0%,落后于 Grok 和 Qwen 的相关模型。速度上,GPT-Live-1 的两配置首次音频时间分别为 1.34 秒和 1.24 秒,慢于 Grok Voice Think Fast 2.0 High 的 0.70 秒;成本上分别为每小时 5.83 美元和 4.47 美元。

    推荐理由:该内容汇总了 GPT-Live-1 在不同后端配置下的语音智能体基准成绩,包含偏好、任务成功率、音频推理、速度和成本等对比,适合需要评估实时语音模型表现的开发者参考。

  1. The Decoder: AI News(RSS)✦ 精选
    AI 评分 66/100

    Iris-mini 和 Iris-pro 是同级最强的开源权重搜索智能体

    AllSpark团队发布了Iris-mini和Iris-pro,这两个基于Qwen模型构建的开源搜索智能体在各自规模级别的开源权重模型中领先基准测试。论文称,这些训练数据和模型还在从未训练过的任务上提升了表现,包括通用工具使用和办公任务。

    推荐理由:该文简要介绍了两个开源搜索智能体的基准表现与泛化能力,适合关注开源模型和搜索智能体进展的读者快速了解其定位。

  2. @rohanpaul_ai✦ 精选
    AI 评分 84/100

    斯坦福与MIT论文:模型表现不只看模型本身,外围harness同样关键

    论文认为模型性能不只取决于大模型本身,还取决于周围的系统代码“harness”。相同底层LLM下,不同harness在同一基准上可能带来最高6倍的性能差距。论文提出Meta-Harness,通过让优化智能体访问先前代码、日志和执行轨迹来自动改进harness。结果显示:在线文本分类上比强SOTA上下文管理提高7.7个点,同时少用4倍上下文token;在检索增强数学推理中,五个留出模型在200道IMO级别问题上平均提升4.7个点;在智能体编码上,发现的harness超过TerminalBench-2上的强人工设计基线。

    推荐理由:适合关注AI系统设计、RAG和智能体工程的读者,理解真实部署中模型外围代码对性能与可靠性的影响,并了解自动化优化模型harness的最新实证结果。

  1. @jiqizhixin✦ 精选
    AI 评分 78/100

    AI智能体真的能在真实网站上订机票、报费用、投工作申请吗?MMLU-Pro作者等推出ClawBench

    MMLU-Pro作者与TIGER Lab、UBC NAIL、UniPat AI、CMU共同推出ClawBench,在144个真实生产网站和153项日常在线任务上评估AI智能体。与使用沙盒或少量虚拟机应用的旧基准不同,ClawBench无沙盒、无静态页面,智能体需像人一样处理认证、动态内容、弹窗和真实UI复杂度。结果显示,最强模型Claude Sonnet 4.6成功率仅33%,三分之二任务失败;GPT-5.4仅完成10/153项,成功率为6.5%;68项任务无任何模型完成。研究认为当前基准掩盖了从“能用浏览器”到“能真正完成工作”的巨大差距。

    推荐理由:该研究暴露了现有网页智能体基准的局限,为关注AI智能体实际落地、评测方法和模型能力边界的读者提供重要参考。

已显示 4 条新闻,共 4 条。已显示全部 4 条新闻