AI HOT 日报 约 8 分钟

AI HOT 日报 · 2026-07-18

AI HOT 公开接口整理,共 18 条。

模型发布/更新

产品发布/更新

行业动态

论文研究

论文研究

月之暗面在GTC 2026披露Kimi K2.5技术路线:用MuonClip、线性注意力与Agent Swarm重构三大基础组件

月之暗面CEO杨植麟在GTC 2026演讲中提出用MuonClip优化器替代Adam,可将数据利用效率提升近一倍。同时推出Kimi Linear线性注意力,在百万Token上下文下全面超越全注意力;Agent Swarm已支持300个Agent并行工作。

X:宝玉 (@dotey)
论文研究

Schema Harness 在 ARC-AGI-3 公开集上取得约 99% 成绩

Schema 框架在 ARC-AGI-3 公开集上,使用 Claude Opus 4.8 和 Fable 5 达到 99% RHAE 分数,使用 GPT-5.6 Sol 达到 95.35%。该框架不修改模型权重,而是将原始观测转化为可编辑程序,联合解决状态归因和机制发现问题。此前

Hacker News 热门(buzzing.cc 中文翻译)
论文研究

美团LongCat发布LoHoSearch:更难搜索智能体基准

美团LongCat推出LoHoSearch,一个基于762万实体维基百科知识图谱自动生成问题的搜索智能体基准,旨在解决BrowseComp等现有基准趋于饱和的问题。在11个前沿模型测试中,最佳得分仅34.74%,远低于当前模型在BrowseComp上约90%的成绩;上下文策略仅带

X:美团 LongCat (@Meituan_LongCat)
论文研究

Apple 研究:Show Me Examples — 从图像集推断视觉概念

Apple 机器学习研究团队提出一种方法,让视觉语言模型(VLM)仅从图像集示例中推断视觉概念,无需文本指令。该方法通过对比示例图像与候选图像,使模型捕捉颜色、纹理等视觉规律,在多个概念推理基准上提升准确率。该研究目前为学术论文,未公布模型或 API 可用性。

Apple Machine Learning Research(RSS)

技巧与观点

技巧与观点

八天四款前沿模型发布,Kimi K3 跻身第三

过去八天内,Grok 4.5、GPT-5.6、Muse Spark 1.1 与 Kimi K3 四款前沿模型相继发布,使 Artificial Analysis Intelligence Index 得分超 50 的实验室从 6 月初的 2 家增至 6 家。

X:Artificial Analysis (@ArtificialAnlys)
技巧与观点

首届“小有可为”大赛乡村教育一等奖作品“智绘科普”技术拆解

首届“小有可为”大赛乡村教育赛道一等奖作品“智绘科普”采用 Qwen3.5-397B-A17B 大语言模型与 Manim 动画引擎,通过多Agent分阶段协作与自动修复机制,将知识主题转化为可控、可编辑的教学动画。系统包含规划、草稿、实现、审查、合成五个阶段,渲染失败时可自动提取

公众号:通义实验室(千问)
技巧与观点

生成式人工智能是一场工程灾难:AI公司抢购70%高端内存,推高电脑价格

AI公司为维持大语言模型(如ChatGPT、Claude)运行,可能已购买全球70%的高端计算机内存,导致内存与存储价格飙升:两年前350美元的硬盘现已涨至800美元且缺货,部分笔记本电脑涨价50%。科技公司计划未来几年将美国数据中心容量扩大8倍,部分站点甚至用喷气发动机供电。预

Hacker News 热门(buzzing.cc 中文翻译)
技巧与观点

Cursor 评估负责人确认 Claude Fable 5 在 CursorBench 达 72.9% 新高

Cursor 的模型评估负责人 Nate Schmidt 发现,Claude Fable 5 在其内部基准 CursorBench 上以 Max effort 模式达到 72.9%,创下新高。该模型在模糊的真实编程任务中表现出全局推理能力,例如在航天模拟器中仅凭一句提示自主规划并

Claude:Blog(网页)
技巧与观点

OpenAI 提出 AI 时代记分卡:“有用智能每美元”衡量实际工作价值

OpenAI 提出“Useful Intelligence per Dollar”(有用智能每美元)作为衡量 AI 投资回报的核心指标,从完成的有用工作量、成功任务的实际成本、结果可靠性三个维度评估。

OpenAI:官网动态(RSS · 排除企业/客户案例)
技巧与观点

Anthropic 副首席信息安全官发布智能体 AI 风险评估框架:零风险不是目标

Anthropic 副首席信息安全官 Jason Clinton 分享了其团队在采用智能体 AI 过程中的经验教训,并提出了一套用于安全构建和部署智能体的风险评估框架。该框架通过四个核心问题(摄入的不可信内容、可执行的操作、失控时的爆炸半径、可观测性)来评估风险,并强调“最小代理

Claude:Blog(网页)
技巧与观点

AI 时代“小需求”的成本逻辑变了:GitHub 博客谈工程决策新范式

工程师对小型功能请求的决策成本已超过代码实现成本。AI 智能体可在会议预热时间内生成首个补丁,将抽象的“是否在范围内”争论转化为可审查的具体产物。关键区分在于:代码生成便宜不等于维护便宜,只有人类能自信审查并承担长期责任的变更才算低成本。

GitHub Blog