跳到正文
  1. The Decoder82

    Anthropic 发布 Claude Haiku 5.5,价格较 Haiku 4.5 平均降约 75%

    Anthropic 发布 Claude Haiku 5.5,这是其目前最快、最便宜的小模型,平均价格比 Haiku 4.5 低约 75%,10 万 token 以内提示词最高降价 90%,超过 10 万 token 则贵 5 倍。

    推荐理由:Haiku 5.5 的定价与基准数据同时给出,读者可据此判断小模型在智能体与计算机操作任务中的性价比变化。

  1. 东方财富研报·行业62

    金圆统一证券:大模型从技术竞赛到商业闭环,AI生态收敛与竞争格局前瞻

    金圆统一证券发布人工智能系列研报,指出全球大模型需求高增长且行业集中度提升,OpenRouter平台周度Token调用量由2025年9月的5.26T增至2026年9月约127T,DeepSeek、Google、OpenAI三家合计份额超60%,中国模型在TOP10中合计份额超40%。

    推荐理由:研报用OpenRouter周度Token调用量等数据,梳理大模型从技术竞赛转向商业闭环的竞争格局与三类厂商路径。

  1. Mistral AI82

    Mistral 发布 Mistral Large 4 公开预览,1 万亿参数原生多模态

    Mistral AI 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、49B 激活参数的原生多模态模型,可在 Mistral Studio 试用预览 API,权重将于本月底发布。

    推荐理由:官方给出 1 万亿参数、49B 激活的开放权重模型在编码、智能体与网络安全上的具体评测数字,可据此判断开放权重模型当前的能力边界。

  2. Latent Space78

    Reflection 发布 Beam:501B-A23B 美国开源 MoE 模型

    Reflection 发布 Beam,一个面向编码、智能体与科研任务的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,Apache 2.0 全量权重预计本月放出。

    推荐理由:Reflection 从隐身状态交出首个开源权重模型,读者可据此判断美国开源阵营与 DeepSeek、GLM 等中国模型的相对位置。

  3. AWS Machine Learning Blog62

    GLM 5.3 上线 Amazon Bedrock

    智谱(Z.ai)的 GLM 5.3 已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码与长时程智能体任务,可通过全托管 API 调用。

    推荐理由:GLM 5.3 在 Bedrock 上的托管接入与提示词缓存用法,可帮助读者判断长时程编码与安全测试工作流的落地成本。

  4. The Decoder77

    Reflection 发布首个开源权重模型 Beam,主打低算力编码与智能体任务

    AI 公司 Reflection 发布首个免费开放模型 Beam,面向编码、逻辑推理和智能体任务,采用 MoE 架构,每 token 激活 5010 亿总参数中的 230 亿。

    推荐理由:Beam 以 MoE 架构和超大规模 RL 训练换取低算力成本,读者可据此判断开源模型在编码与智能体任务上的性价比路线。

  1. GitHub Blog · AI & ML62

    GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准

    GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 19 种语言的 219 个公开 pull request。

    推荐理由:GitHub 公开了代码审查基准的构建方法与评分口径,读者可据此理解 AI 代码审查评测的取舍。

  1. Google DeepMind82

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者。

    推荐理由:官方披露了 Argon 在编码、企业知识与网络安全防御上的能力与定价,可据此判断前沿模型的分阶段开放路径。

  1. GitHub Blog · AI & ML80

    GitHub Copilot 用 Copilot 把运行时迁移到 Rust

    GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体写了大部分代码,分布在 128 个 PR 中增量合入 main,而非一次性切换。

    推荐理由:作者以亲历者身份给出把 80 万行运行时迁到 Rust 的完整工程细节,可迁移到大规模 Agent 协作开发。

已经到底了