AI HOT 日报 · 2026-09-03
由 AI HOT 公开接口整理,共 15 条。
模型发布/更新
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber 两款新模型
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber。
Google DeepMind:Blog(RSS) 模型发布/更新Meta 发布 Muse Spark 1.3,智能体与科学推理能力提升
Meta 发布 Muse Spark 1.3,是五个月内第四个 Muse Spark 版本。xhigh 版在 Artificial Analysis Intelligence Index 得 61 分。
X:Alexandr Wang(Scale AI 创始人/Meta 首席 AI 官) (@alexandr_wang) 模型发布/更新Qwen3.8-Max-0902 登顶 Code Arena 并以 $5/MToken 领跑 Pareto 前沿
通义千问发布 Qwen3.8-Max-0902,在 Code Arena: WebDev 以 1,691 分首次亮相即排名总榜第一,并以混合价 $5/MToken 成为 Pareto 前沿上得分最高的模型,现已可在 QwenCloud 试用。
X:通义千问 / Qwen (@Alibaba_Qwen)产品发布/更新
Claude 在 Cowork 和 Claude Code 中支持后台操作电脑
Claude 官方宣布 Claude Cowork 和 Claude Code 新增后台使用电脑的能力。用户把任务交给 Claude 后,它会像人一样点击、输入和打开应用,用户可同时去做其他事。
X:Claude (@claudeai) 产品发布/更新Cursor 推出 Self-Hosted Machines,云智能体可在企业自有机器上执行
Cursor 发布 Self-Hosted Machines,让云智能体的工具执行迁移到企业自有网络内的机器,智能体循环、推理和规划仍留在 Cursor 云端,通过 worker 的出站 HTTPS 连接对接,Cursor 不会主动连入企业网络。
Cursor Blog 产品发布/更新美团 LongCat-2.0 上线 Cline 免费试用
点击查看原文
X:美团 LongCat (@Meituan_LongCat) 产品发布/更新UU远程新版本上线:完整 TUI 渲染与多终端会话管理,强化远程 Vibe Coding 体验
UU远程于9月2日上线新版本,重点优化终端功能,补齐 TUI 渲染交互与终端会话管理能力。主要更新包括:Mac 免密码登录、移动端输入优化并新增调用系统输入法的独立输入框、可同时创建和管理多个终端会话并支持手机与电脑间跨端同步接管(通过 uuyc-cli lterm 命令)。
公众号:数字生命卡兹克行业动态
Nvidia 接近以 129 亿美元收购 Hugging Face
Bloomberg 报道 Nvidia 正接近以约 129 亿美元收购 Hugging Face,交易总额可能达约 140 亿美元,双方尚未达成最终协议,时间与细节仍可能变动。该价格约为 Hugging Face 2023 年融资轮 45 亿美元估值的 2.9 倍,按年化收入约
X:Rohan Paul (@rohanpaul_ai) 行业动态OpenAI 因 Tumbler Ridge 枪击案面临 30 起新诉讼,被指协助教唆
OpenAI 及 CEO Sam Altman 面临 30 起新诉讼,指控其为加拿大 Tumbler Ridge 校园枪击案嫌疑人提供实质性协助与鼓励,诉讼由事发时在校的学生、教师和校长于加州联邦法院提起。
The Verge:AI(RSS)技巧与观点
美国司法部就 OpenAI 版权诉讼提交意见书支持训练属于合理使用
美国司法部在 OpenAI 与纽约时报的版权诉讼中提交意见书,主张用受版权文本训练 LLM 一般应属合理使用,称模型训练具有非凡转换性,并以国家安全为由警告全面许可要求会削弱美国 AI 开发者竞争力。该意见书属建议性质、不约束法院,仍将数据获取方式与具体输出是否复制受保护段落作为
X:Rohan Paul (@rohanpaul_ai) 技巧与观点什么是 harness 工程?Google 用 ADK 2.0 与 Antigravity SDK 演示自动修复编码循环
Google 员工 Shir Meir Lador 介绍 harness 工程,即用确定性组件包裹 LLM,包括编排层、执行沙箱、状态持久化和验证工具,让 Agent 不需逐行人工审查即可安全生成代码。
Google AI:DEV 作者专属(RSS) 技巧与观点Google AI 团队分享如何为 LLM-as-a-Judge 评测编写可靠的评分标准
Google AI 团队发布教程,讲解如何为 LLM-as-a-Judge 评测编写可靠的布尔式评分标准,指出模糊提示会导致评估不一致和浪费 token。文中给出四条经验:问题保持原子化且互不重叠、只让评判模型评估客观事实(可用 RFC 2119 术语如 MUST 表述)、只评
Google AI:DEV 作者专属(RSS) 技巧与观点Anthropic 发布电商 Agent 架构与生产实践指南,并开源 commerce-agents 参考实现
Anthropic 发布电商 Agent 构建指南,基于与零售、旅游、电信等团队的落地经验,核心架构是单个 Claude 在标准 Agent 循环中配合技能与工具,而非按领域拆分子智能体,并开源了 anthropics/commerce-agents 参考实现,含购物与商家 Ag
Claude:Blog(网页) 技巧与观点GitHub Copilot 如何在不牺牲任务质量的前提下降低 AI 编码成本
GitHub 工程师 Erik Kristensen 分享了 Copilot 降本的四项改动:选择性压缩工具输出、移除 view 工具行号前缀(线下推理成本降约 5%,线上用户日均推理成本降约 3%)、压缩 task-tool 提示词(每轮省约 1300 token,每活跃小时归
GitHub Blog 技巧与观点Google 总结 AI Agents Challenge 中最强提交背后的 4 个工程模式
Google 复盘 AI Agents Challenge 赛事,从各赛道头部提交中提炼出四个工程模式:双向 MCP、事件驱动并发、同标准回退和分层路由。
Google Developers Blog(RSS)