Anthropic 发布 Claude Haiku 5.5,价格较 Haiku 4.5 平均降约 75%
Anthropic 发布 Claude Haiku 5.5,这是其目前最快、最便宜的小模型,平均价格比 Haiku 4.5 低约 75%,10 万 token 以内提示词最高降价 90%,超过 10 万 token 则贵 5 倍。
推荐理由:Haiku 5.5 的定价与基准数据同时给出,读者可据此判断小模型在智能体与计算机操作任务中的性价比变化。
Anthropic 发布 Claude Haiku 5.5,这是其目前最快、最便宜的小模型,平均价格比 Haiku 4.5 低约 75%,10 万 token 以内提示词最高降价 90%,超过 10 万 token 则贵 5 倍。
推荐理由:Haiku 5.5 的定价与基准数据同时给出,读者可据此判断小模型在智能体与计算机操作任务中的性价比变化。
英伟达团队从 Nemotron 3 出发,用 SFT、RL 和生成-验证-精炼推理流程,让模型在 IOI 2026 拿到 535.4/600、在 IMO 2026 拿到 30/42,均超过官方金牌线。
推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可复用到其他高难领域。
GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 19 种语言的 219 个公开 pull request。
推荐理由:GitHub 公开了代码审查基准的构建方法与评分口径,读者可据此理解 AI 代码审查评测的取舍。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再根据其留下的后端终态和副作用打分,而非看模型生成的文字。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定任务成败,并给出可复现的 OpenEnv 运行方式。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,首发仅限政府用户和 Fairwind 计划中的可信网络防御者,开发者与企业访问时间未定。
推荐理由:汇总了 Gemini 4 Argon 的基准、定价与可用范围,并列出评测机构与观察者的质疑,便于对照官方口径。
OpenAI 在 DevDay 2026 上发布 Dots 常驻智能体、GPT-6.1 Sol 模型、Ultrafast 加速模式、Decisions API 与 ChatGPT Spaces,并称 ChatGPT 周活达 12 亿。
推荐理由:汇总 OpenAI DevDay 2026 的发布清单与第三方评测数据,可快速了解智能体产品与模型定价的当期格局。
NVIDIA 发布开源表格基础模型 Kumo Tabular,给定带标签的表格行即可在单次前向中预测新行标签,支持分类与回归,无需训练、调参和特征工程。模型提供 28M 到 215M 三种规模,仅用人工合成表格预训练,采用 OpenMDW-1.1 许可可商用,并在 TabArena、BeyondArena、TALENT 和 ScoringBench 四个基准上排名第一。
推荐理由:原文给出模型规模、单次前向预测方式和四个基准排名,可据此判断表格基础模型对现有建模流程的替代空间。
Mistral 发布 Agentic Search,作为检索层让模型在多步循环中查找、检查和验证信息,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries。
推荐理由:原文给出多步检索循环的工具设计与两组基准数字,可据此判断传统一次性 RAG 在长文档上的边界。