跳到正文
  1. OpenAI News85

    OpenAI 在 ChatGPT 全球上线 GPT-6 与 Intelligent UI

    OpenAI 宣布 GPT-6 正在 ChatGPT 中面向全球上线,并同步推出 Intelligent UI。官方称其响应更快,并带来可视化与可直接探索使用的交互体验。

    推荐理由:OpenAI 官方公布 GPT-6 在 ChatGPT 全球上线,并同步带来 Intelligent UI 的交互变化。

  2. NVIDIA Blog72

    NVIDIA 与 Microsoft 发布 RTX Spark 及 Windows 智能体基础设施

    NVIDIA 与 Microsoft 在旧金山 Windows AI 活动上宣布为 Windows PC 的 AI 智能体共同设计软硬件,Microsoft 宣布操作系统级基础设施 Microsoft Execution Containers(MXC)正式可用,让智能体在系统控制下安全持久地在后台运行。

    推荐理由:NVIDIA 与 Microsoft 把智能体运行所需的系统级容器和本地算力硬件一并给出,可据此判断本地智能体的落地路径。

  3. Google Research71

    Google Research 三个月实验:AI 辅助提升专利撰写产出,但未加速初级律师判断力成长

    Google Research 在 NBER 发布三个月实地实验,将当时未发布的 Google Labs AI 专利撰写助手(现属 Gemini Notebook)随机开放给 11 家知识产权律所的 133 名律师。

    推荐理由:三个月专利撰写实验区分了AI带来的即时产出提升与无辅助判断力的变化,为理解AI对专业能力的影响提供了实证。

  4. Microsoft Research71

    微软研究院开源 Agent Lightning v1.0:3500 行轻量智能体 RL 框架,支持真实 harness 训练

    微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的 agent harness 直接参与训练,无需在训练框架内重新实现智能体。

    推荐理由:微软研究院开源 Agent Lightning v1.0,读者可了解无需重写 harness 的智能体 RL 训练范式与 3500 行实现。

  5. GitHub Blog · AI & ML66

    GitHub 推出基于 ModernBERT 的通用密钥检测模型,扩展推送保护

    GitHub 发布基于 ModernBERT 的通用密钥检测分类器,利用上下文在 2 毫秒内评估候选密钥,可将可拦截的密钥数量提升一倍以上。

    推荐理由:GitHub 公开九季度密钥泄露数据,并说明新分类器如何把推送拦截扩展到非结构化密钥。

  6. AWS Machine Learning Blog62

    Claude Haiku 5.5 上线 Amazon Bedrock 与 Claude Platform on AWS

    AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用。

    推荐理由:文章给出 Haiku 5.5 在 Bedrock 上的能力定位与调用方式,可据此判断它在多智能体分工中的成本位置。

  7. Hugging Face Blog62

    Liquid AI 开源 d1-3B 与 d1-omni-600M 端侧决策模型

    Liquid AI 发布 d1 决策模型家族的两款开源模型 d1-3B 和 d1-omni-600M(实验性),均基于其 LFM 构建,不生成 token 而是在单次前向传播中给出答案。

    推荐理由:Liquid AI 开源两款决策模型,给出决策质量、端侧延迟与多模态输入的具体数据,可据此判断边缘场景的可用性。

  1. Google DeepMind66

    Google DeepMind 发布 EmbeddingGemma 2 开源多模态嵌入模型

    Google DeepMind 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、Apache 2.0 许可的开源多模态嵌入模型,参数量 740M,可将文本、图像、音频、视频映射到统一嵌入空间。

    推荐理由:官方给出参数量、分模块编码器与端侧内存占用,可据此判断本地多模态检索的落地成本。

  2. OpenAI News62

    OpenAI 公布前沿模型在数学开放问题上的进展

    OpenAI 发布内部前沿模型在数学开放问题上的新结果,并在 GitHub 公开 Lean 证明形式化与研究细节。

    推荐理由:OpenAI 公开内部前沿模型在数学开放问题上的结果与 Lean 形式化证明,可了解其研究路径。

  3. Google Research62

    Google Earth AI 的 PDFM 地理空间基础模型在五项全球公共卫生任务中的验证

    Google Research 发布研究,用 Google Earth AI 的 Population Dynamics Foundation Model(PDFM)作为概念验证,展示自监督预训练的“地点”表征可作为即插即用输入接入现有流行病学模型,无需任务特定微调。

    推荐理由:Google 用五个公共卫生案例验证地理空间基础模型嵌入可直接接入现有流行病学流程,读者可了解其验证范围与量化增益。

  4. Hugging Face Blog60

    Nemotron 微调后在 IOI 2026 与 IMO 2026 双双达到金牌水平

    英伟达团队从 Nemotron 3 出发,用 SFT、RL 和生成-验证-精炼推理流程,让模型在 IOI 2026 拿到 535.4/600、在 IMO 2026 拿到 30/42,均超过官方金牌线。

    推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可复用到其他高难领域。

  1. Mistral AI82

    Mistral 发布 Mistral Large 4 公开预览,1 万亿参数原生多模态

    Mistral AI 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、49B 激活参数的原生多模态模型,可在 Mistral Studio 试用预览 API,权重将于本月底发布。

    推荐理由:官方给出 1 万亿参数、49B 激活的开放权重模型在编码、智能体与网络安全上的具体评测数字,可据此判断开放权重模型当前的能力边界。

  2. AWS Machine Learning Blog62

    GLM 5.3 上线 Amazon Bedrock

    智谱(Z.ai)的 GLM 5.3 已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码与长时程智能体任务,可通过全托管 API 调用。

    推荐理由:GLM 5.3 在 Bedrock 上的托管接入与提示词缓存用法,可帮助读者判断长时程编码与安全测试工作流的落地成本。

  1. GitHub Blog · AI & ML62

    GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准

    GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 19 种语言的 219 个公开 pull request。

    推荐理由:GitHub 公开了代码审查基准的构建方法与评分口径,读者可据此理解 AI 代码审查评测的取舍。

  1. Hugging Face Blog62

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再根据其留下的后端终态和副作用打分,而非看模型生成的文字。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定任务成败,并给出可复现的 OpenEnv 运行方式。

  1. NVIDIA Blog76

    NVIDIA GPU 如何加速 OpenAI GPT-6 Astra Ultrafast

    OpenAI 的 GPT-6 Astra Ultrafast 已在 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户中开放,运行在 NVIDIA Blackwell GPU 上,token 生成速度最高比 Astra Standard 模式快 8 倍。

    推荐理由:原文给出 Ultrafast 模式相对标准模式的加速倍数与开放入口,读者可据此判断它对编码智能体循环的实际影响。

  2. Google Research62

    Google 发布基于 TEE 的新一代联邦学习系统

    Google Research 公布新一代联邦学习系统,用可信执行环境(TEE)为数据匿名化提供可远程验证和审计的保证,并已由 Gboard 采用。系统通过访问策略公开透明日志、KMS 密钥管理与可复现构建,使加密训练数据只能在符合策略的 TEE 内解密处理。Gboard 已用该系统上线英语和日语下一词预测模型,训练时间从此前的 1-2 个月缩短,目前主要受 TEE 资源限制。

    推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的落地情况,可了解隐私可验证训练的实现路径。

  3. NVIDIA Blog62

    NVIDIA DGX Spark 推出 64GB 版本,双机可集群扩展至 128GB

    NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 64GB 统一内存版 DGX Spark,10 月 23 日开售,起售价 4,999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 与完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在本地运行。

    推荐理由:原文给出 64GB 新配置的价格、上市时间与双机集群实测数据,可据此判断本地跑大模型的成本与扩展方式。

  4. Hugging Face Blog60

    Ai2 开源科学报告生成模型 AstaBrief 8B

    Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的小模型,基于 Qwen3-8B 训练,已作为 Asta 的 Fast 模式上线,同时开放模型权重和训练数据。

    推荐理由:原文给出了从 Qwen3-8B 出发的 SFT 加 DPO 训练配方与数据过滤经验,可迁移到其他垂直领域小模型。

  1. Google DeepMind82

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者。

    推荐理由:官方披露了 Argon 在编码、企业知识与网络安全防御上的能力与定价,可据此判断前沿模型的分阶段开放路径。