跳到正文
今天10月8日周四2 条
  1. Simon Willison78

    Anthropic 发布 Claude Haiku 5.5,定价对齐 GPT-6 Luna

    Anthropic 发布快速低成本模型 Claude Haiku 5.5,定价为 $0.10/$0.50,与上月发布的 OpenAI GPT-6 Luna 完全一致,超过 100,000 tokens 后涨至 $0.50/$2.50,而 Luna 在 272,000 tokens 后仅涨至 $0.20/$0.75。

    推荐理由:作者实测了 Haiku 5.5 的定价、分词器与推理档位,并对比 GPT-6 Luna,可据此判断不同用量下的成本差异。

  2. Hugging Face Blog62

    Liquid AI 开源 d1-3B 与 d1-omni-600M 端侧决策模型

    Liquid AI 发布 d1 决策模型家族的两款开源模型 d1-3B 和 d1-omni-600M(实验性),均基于其 LFM 构建,不生成 token 而是在单次前向传播中给出答案。

    推荐理由:Liquid AI 开源两款决策模型,给出决策质量、端侧延迟与多模态输入的具体数据,可据此判断边缘场景的可用性。

10月7日周三
10月6日周二
  1. Mistral AI82

    Mistral 发布 Mistral Large 4 公开预览,1 万亿参数原生多模态

    Mistral AI 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、49B 激活参数的原生多模态模型,可在 Mistral Studio 试用预览 API,权重将于本月底发布。

    推荐理由:官方给出 1 万亿参数、49B 激活的开放权重模型在编码、智能体与网络安全上的具体评测数字,可据此判断开放权重模型当前的能力边界。

  2. The Decoder77

    Reflection 发布首个开源权重模型 Beam,主打低算力编码与智能体任务

    AI 公司 Reflection 发布首个免费开放模型 Beam,面向编码、逻辑推理和智能体任务,采用 MoE 架构,每 token 激活 5010 亿总参数中的 230 亿。

    推荐理由:Beam 以 MoE 架构和超大规模 RL 训练换取低算力成本,读者可据此判断开源模型在编码与智能体任务上的性价比路线。

  3. TechCrunch · AI71

    Reflection 发布开源权重模型 Beam,对标中国开源模型并降低推理算力成本

    Reflection AI 发布首款前沿开源权重模型 Beam,称其在高级推理基准上与中国领先开源模型持平,且推理算力消耗低 3-4 倍。Beam 是 5010 亿参数、230 亿激活参数的文本 MoE 模型,预训练使用 23.8 万亿 token,上下文窗口 100 万 token,公司称其性能与 Z.ai 的 GLM-5.2 相当并优于当前西方领先开源模型。

10月5日周一
  1. Simon Willison22

    Qwen3.8 27B 用英文单词做加法的基准测试

    Simon Willison 在 DGX Spark 上测试本地 Qwen3.8-27B-Q4_K_M.gguf 能否仅用英文单词表达整数加法结果,禁用推理时 5,070 个用例的数值准确率为 23.57%,格式合规率 96.17%,但准确率从一至三位数的 97.04% 降至十至十三位数的 6.44%。启用推理后,169 个配对用例中答对 167 个。

10月2日周五
  1. NVIDIA Blog76

    NVIDIA GPU 如何加速 OpenAI GPT-6 Astra Ultrafast

    OpenAI 的 GPT-6 Astra Ultrafast 已在 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户中开放,运行在 NVIDIA Blackwell GPU 上,token 生成速度最高比 Astra Standard 模式快 8 倍。

    推荐理由:原文给出 Ultrafast 模式相对标准模式的加速倍数与开放入口,读者可据此判断它对编码智能体循环的实际影响。

10月1日周四
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者。

    推荐理由:官方披露了 Argon 在编码、企业知识与网络安全防御上的能力与定价,可据此判断前沿模型的分阶段开放路径。

9月16日周三
8月24日周一
  1. Import AI22

    Import AI 470:机器不应享有权利;用 SPADE 自动生成环境;用 Hawkeye 构建更好的 GPU kernel

    METR 研究显示 AI 对科学的加速并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域仅小幅加速,AI 研究本身则无可测量的加速。SPADE 通过自博弈让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上使游戏环境套件平均分达 58.3,较基线提升 8.1。

8月13日周四
  1. Microsoft Research38

    MindTopo:微软推出评估多模态模型拓扑推理能力的新基准

    微软研究院推出 MindTopo 基准,用于评估多模态大语言模型在连通性、封闭性、顺序、分离和绳结五类拓扑关系上的推理与规划能力。测试显示,当前专有与开源模型在静态识别上明显强于交互式规划,且均远低于人类水平,失败多出现在规划阶段而非感知阶段。图像与视频生成仅在单帧关系可见时偶有帮助,跨多步操作时仍不可靠。

7月29日周三
5月8日周五
  1. Berkeley AI Research38

    自适应并行推理:高效推理扩展的下一个范式

    伯克利 AI 研究团队发布综述,分析并行推理领域进展,重点讨论自适应并行推理——让推理模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调。文章指出,顺序推理随探索量线性扩展,会遭遇上下文退化(context-rot)并导致延迟随推理长度成比例增长,复杂任务常需用户等待数十分钟甚至数小时。

4月20日周一
  1. Berkeley AI Research36

    GRASP:面向世界模型长时程规划的梯度规划器

    Berkeley AI Research 提出 GRASP,一种面向学习动力学(世界模型)的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接加入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度,使长时程规划更实用、更稳健。

3月13日周五
  1. Berkeley AI Research38

    Berkeley AI Research 提出 SPEX 与 ProxySPEX:大规模识别 LLM 交互关系

    Berkeley AI Research 提出 SPEX 和 ProxySPEX 算法,用于在大规模 LLM 中识别关键交互关系。方法以消融为核心,通过移除输入提示词的特定片段并测量预测变化来实现特征归因。随着特征、训练数据和模型组件数量增长,潜在交互数量呈指数级上升,穷举分析在计算上不可行。