AI HOT 日报 约 7 分钟

AI HOT 日报 · 2026-08-29

AI HOT 公开接口整理,共 16 条。

模型发布/更新

产品发布/更新

产品发布/更新

Open ASR 排行榜新增首个全球南方语言:印地语与印度英语评测集

Voice Arena 与 Hugging Face 合作,为 Open ASR 排行榜引入 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,覆盖印地语与印度英语,其中印地语是该排行榜多语言板块首个非欧洲语言。数据集含公开与私有分割,共 4,888 位说话

Hugging Face:Blog(RSS)
产品发布/更新

Claude Code v2.1.251 发布:新增模型切换钩子与远程控制流式输出

Claude Code v2.1.251 新增 PreModelSwitch 和 PostModelSwitch 钩子事件,支持拦截、确认或标注模型切换;远程控制客户端现可实时流式查看前台子代理的工具调用与结果。/usage 新增消费限额条,/cost 新增按会话的提示词缓存统计

Claude Code:GitHub Releases(RSS)
产品发布/更新

Databricks Genie One 新增功能:将洞察转化为行动

Databricks 为 Genie One 推出新功能,帮助用户将 AI 生成的洞察直接转化为实际行动。新功能聚焦于从“回答问题”到“执行任务”的延伸,使用户能在同一界面内基于分析结果触发后续操作,减少来回切换工具的成本。具体功能细节与可用性未在原文中详述。

Databricks:Blog(RSS)
产品发布/更新

Claude for Teachers 面向学校和学区开放免费 Enterprise 版本

Anthropic 将 Claude for Teachers 作为免费 Enterprise 产品开放给学校和学区,提供基于学习科学的 teaching skills 及覆盖全美 50 州的学术标准连接。

Claude:Blog(网页)

行业动态

论文研究

论文研究

Anthropic 让 Claude 自主训练模型以缓解对齐失败

Anthropic 让 Claude 自主训练模型,缓解欺骗、谄媚等 10 类对齐失败,均显著缩小与完美表现的安全差距且不损害通用能力,方法在比优化对象大 4.7 倍的模型上依然有效。Claude 还超越 28 名人类安全研究员,其欺骗场景最佳方法比人类最佳方案好 20%。

Anthropic:Research(发表成果 · 网页)
论文研究

Terminal-Bench-Science 0.1:评估科研工作流中的 AI 智能体

斯坦福大学研究人员领衔发布 Terminal-Bench-Science 0.1,用来自生命、物理、地球、数学和工程科学的 70 个专家精选任务评估 AI 智能体的科研能力。

Hacker News 热门(buzzing.cc 中文翻译)
论文研究

Infer-forge:围绕 SGLang 的 Harness、Loop 与 Graph 工程

Infer-forge 是一套围绕 SGLang 推理优化的内部工程系统,通过 MonoRepo、Harness、Task Loop 与 Task Graph 四种结构,将部署点约束链(模型、SLO、拓扑、运行时、加速平台)转化为可复现、可审计的工程流程。

LMSYS:Blog(Chatbot Arena 团队)
论文研究

LLM 并非(始终)符合贝叶斯:量化 LLM 概率信念的内部(不)一致性

苹果机器学习研究团队提出一种新方法,将 LLM 视为信息处理规则,利用其与贝叶斯更新的信息处理差距,研究模型如何根据证据更新概率信念的内部(不)一致性。实验评估了 LLM 在医学、科学、法律等复杂领域的信念更新表现,揭示其概率推理与贝叶斯理想之间的系统性偏差。

Apple Machine Learning Research(RSS)
论文研究

Agent Seer:从工具规格理解中合成评测场景

Agent Seer 提出一种无需人工构建或实时执行工具即可合成评测场景的方法,利用函数名、自然语言描述和类型化参数模式等工具规格中的语义信息,生成能反映从业者组合工具与多轮迭代的真实测试场景。该方法旨在解决手工构建场景依赖领域专家、难以跨工具生态扩展且静态基准无法跟踪 API

Apple Machine Learning Research(RSS)

技巧与观点