Nemotron 微调后在 IOI 2026 与 IMO 2026 双双达到金牌水平
英伟达团队从 Nemotron 3 出发,用 SFT、RL 和生成-验证-精炼推理流程,让模型在 IOI 2026 拿到 535.4/600、在 IMO 2026 拿到 30/42,均超过官方金牌线。
推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可复用到其他高难领域。
英伟达团队从 Nemotron 3 出发,用 SFT、RL 和生成-验证-精炼推理流程,让模型在 IOI 2026 拿到 535.4/600、在 IMO 2026 拿到 30/42,均超过官方金牌线。
推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可复用到其他高难领域。
OpenAI 发布内部前沿模型在数学开放问题上的新结果,并在 GitHub 公开 Lean 证明形式化与研究细节。
推荐理由:OpenAI 公开内部前沿模型在数学开放问题上的结果与 Lean 形式化证明,可了解其研究路径。
Simon Willison 在 DGX Spark 上测试本地 Qwen3.8-27B-Q4_K_M.gguf 能否仅用英文单词表达整数加法结果,禁用推理时 5,070 个用例的数值准确率为 23.57%,格式合规率 96.17%,但准确率从一至三位数的 97.04% 降至十至十三位数的 6.44%。启用推理后,169 个配对用例中答对 167 个。
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习将奖励对齐的查询扇出编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归的查询扇出,无需测试时 CoT 推理 token。
微软研究院推出 MindTopo 基准,用于评估多模态大语言模型在连通性、封闭性、顺序、分离和绳结五类拓扑关系上的推理与规划能力。测试显示,当前专有与开源模型在静态识别上明显强于交互式规划,且均远低于人类水平,失败多出现在规划阶段而非感知阶段。图像与视频生成仅在单帧关系可见时偶有帮助,跨多步操作时仍不可靠。
Berkeley Sky Lab 团队扩展了进化式内核搜索框架 K-Search,新增 MLX 后端和结构化 CUDA-to-MLX 翻译层,可将现有 CUDA 内核作为知识库自动适配为 Apple Silicon 上的高质量 GPU 内核。
Berkeley AI Research 提出 GRASP,一种面向学习动力学(世界模型)的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接加入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度,使长时程规划更实用、更稳健。
Berkeley AI Research 提出 SPEX 和 ProxySPEX 算法,用于在大规模 LLM 中识别关键交互关系。方法以消融为核心,通过移除输入提示词的特定片段并测量预测变化来实现特征归因。随着特征、训练数据和模型组件数量增长,潜在交互数量呈指数级上升,穷举分析在计算上不可行。