跳到正文
今天10月8日周四3 条
  1. AKShare·财联社电报加红74

    博通为OpenAI定制芯片研发寻求逾500亿美元融资

    知情人士称,博通近几周一直在为与OpenAI共同开发的定制AI芯片寻求超过500亿美元融资,阿波罗和黑石等机构已就参与融资展开洽谈,谈判仍处早期阶段,融资规模可能调整。

    推荐理由:融资规模与芯片代号首次披露,可了解OpenAI自研芯片项目的资金安排与推进节奏。

  2. Microsoft Research71

    微软研究院开源 Agent Lightning v1.0:3500 行轻量智能体 RL 框架,支持真实 harness 训练

    微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的 agent harness 直接参与训练,无需在训练框架内重新实现智能体。

    推荐理由:微软研究院开源 Agent Lightning v1.0,读者可了解无需重写 harness 的智能体 RL 训练范式与 3500 行实现。

10月7日周三
  1. The Verge · AI74

    OpenAI 发布 722 篇手稿,称未公开前沿模型解决数百个数学开放问题

    OpenAI 发布了一批共 722 篇手稿,覆盖 372 个结果族,称其中包含对“数百个”数学开放问题的解答,这些结果由一个未公开的前沿模型产出。据新成立的独立顾问组织 AGMAI 介绍,这批成果此前已被期待数周,OpenAI 在 9 月曾表示其模型“解决了数学大部分领域 100 多个长期开放问题”。

  2. TechCrunch · AI27

    Mirror Particle 正在构建人类行为的“世界模型”

    旧金山初创公司 Mirror Particle 正在从零构建一个模拟人类行为及其变化原因的基础模型,而非依赖 LLM 微调来角色扮演目标人群。其引擎结合客户数据、时事、流行文化与社交媒体,追踪“显性行为”及动机变化,已获天使轮融资并接近完成首轮风投。公司下周将参加 TechCrunch Disrupt 2026 的 Startup Battlefield 200。

  3. Google Research62

    Google Earth AI 的 PDFM 地理空间基础模型在五项全球公共卫生任务中的验证

    Google Research 发布研究,用 Google Earth AI 的 Population Dynamics Foundation Model(PDFM)作为概念验证,展示自监督预训练的“地点”表征可作为即插即用输入接入现有流行病学模型,无需任务特定微调。

    推荐理由:Google 用五个公共卫生案例验证地理空间基础模型嵌入可直接接入现有流行病学流程,读者可了解其验证范围与量化增益。

  4. 东方财富研报·行业60

    国金证券:什么AI应用值得长期跟踪

    国金证券发布计算机行业研报,认为大模型能力突破、成本降低与开放权重模型加速迭代推动2026年AI应用百花齐放,重点看好铲子股/卖水人、Infra、定制化重的IT交付、与业务流程深度结合的行业软件四类方向。

    推荐理由:国金证券以四类方向梳理AI应用长期跟踪逻辑,并用海外与国内厂商财报数据交叉印证需求。

  5. 东方财富研报·行业62

    国金证券:AI安全评估——模型能力升级下智能体风险与纵深防御

    国金证券发布计算机行业研报,指出大模型风险正从内容生成扩展到能调用工具、访问外部系统并修改现实状态的智能体。AISI数据显示前沿模型完成初级网络安全任务的成功率由2023年末低于9%升至2025年的50%,METR测得2023年后前沿模型在50%成功率下的任务时长翻倍周期约130.8天。

    推荐理由:研报用AISI与METR数据说明智能体风险已从内容生成扩展到工具调用,并给出训练、评估、运行三阶段的防御框架。

10月6日周二
  1. TechCrunch · AI71

    Reflection 发布开源权重模型 Beam,对标中国开源模型并降低推理算力成本

    Reflection AI 发布首款前沿开源权重模型 Beam,称其在高级推理基准上与中国领先开源模型持平,且推理算力消耗低 3-4 倍。Beam 是 5010 亿参数、230 亿激活参数的文本 MoE 模型,预训练使用 23.8 万亿 token,上下文窗口 100 万 token,公司称其性能与 Z.ai 的 GLM-5.2 相当并优于当前西方领先开源模型。

10月5日周一
10月2日周五
  1. Hugging Face Blog60

    Ai2 开源科学报告生成模型 AstaBrief 8B

    Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的小模型,基于 Qwen3-8B 训练,已作为 Asta 的 Fast 模式上线,同时开放模型权重和训练数据。

    推荐理由:原文给出了从 Qwen3-8B 出发的 SFT 加 DPO 训练配方与数据过滤经验,可迁移到其他垂直领域小模型。

  2. Hugging Face Blog38

    ServiceNow CoreAI 推出 AutoSynthData:为企业智能体生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功示范,定位能力缺口并生成、验证新的可执行训练任务,随模型提升动态调整课程。该流程在 EnterpriseOps Gym 数据集上进行了演示,生成的任务需满足可行性、真实性与难度三项要求,并通过一致性、可靠性与完备性的验证器筛选后用于后训练。

10月1日周四
9月30日周三
  1. Google DeepMind62

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质嵌入水印

    Google DeepMind 发布 SynthID Bio,将 SynthID 水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。

    推荐理由:SynthID 水印技术首次延伸到合成生物学,读者可了解 AI 生成蛋白质如何在保持功能的同时被标记与验证。

9月29日周二
  1. Hugging Face Blog71

    NVIDIA 发布表格基础模型 Kumo Tabular,单次前向完成预测

    NVIDIA 发布开源表格基础模型 Kumo Tabular,给定带标签的表格行即可在单次前向中预测新行标签,支持分类与回归,无需训练、调参和特征工程。模型提供 28M 到 215M 三种规模,仅用人工合成表格预训练,采用 OpenMDW-1.1 许可可商用,并在 TabArena、BeyondArena、TALENT 和 ScoringBench 四个基准上排名第一。

    推荐理由:原文给出模型规模、单次前向预测方式和四个基准排名,可据此判断表格基础模型对现有建模流程的替代空间。

  2. Microsoft Research62

    微软研究院发布 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据联合训练的生物学世界模型,以及连接模型、科学工具、文献与研究者的交互式 harness 组成。

    推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环,并给出胰腺癌化合物筛选的湿实验验证结果。

9月24日周四
  1. NVIDIA Blog62

    NVIDIA 联合 Google DeepMind 等开放 2800 多种病毒的蛋白复合物结构预测数据集

    NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,通过 AlphaFold Database 开放了 2800 多种病毒的蛋白复合物预测 3D 结构,任何科学家均可免费获取。

    推荐理由:NVIDIA 与 Google DeepMind 等联合开放 2800 多种病毒的蛋白复合物结构预测,读者可了解这一开放数据集的规模与用途。

9月21日周一
9月19日周六
9月18日周五
9月16日周三
9月11日周五
9月8日周二
  1. Google DeepMind72

    Google DeepMind 发布 AlphaGenome Atlas,覆盖人类基因组 90 亿个单碱基变异预测

    Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 倍以上,今日起通过网站门户、AlphaGenome API 和 Google Antigravity 中的 skill 向学术研究免费开放。

    推荐理由:AlphaGenome Atlas 把全基因组变异预测做成可检索资源,读者可了解其数据规模与在罕见病研究中的实际用法。

9月3日周四
  1. Google DeepMind71

    Google DeepMind 发布 WeatherNext 3 全球天气 AI 模型

    Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为目前最先进的全球天气模型,可基于实时卫星数据每小时生成一次预报,地表变量分辨率达 5 公里,整体比 WeatherNext 2 清晰约五倍。

    推荐理由:官方给出分辨率、更新频率与降水精度提升幅度,可据此判断 AI 天气预报在 Google 产品中的落地程度。

9月1日周二
8月24日周一
  1. Import AI22

    Import AI 470:机器不应享有权利;用 SPADE 自动生成环境;用 Hawkeye 构建更好的 GPU kernel

    METR 研究显示 AI 对科学的加速并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域仅小幅加速,AI 研究本身则无可测量的加速。SPADE 通过自博弈让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上使游戏环境套件平均分达 58.3,较基线提升 8.1。

8月21日周五
  1. Microsoft Research40

    微软 Skala 1.1 发布:训练数据增至 2.5 倍,并集成进 CP2K 等 DFT 软件

    微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续追踪各版本计算性能的 living benchmark。

7月26日周日
  1. Berkeley AI Research42

    Berkeley AI Research 提出 ABBEL:用信念状态替代递归摘要,提升 LLM 长程交互效率

    Berkeley AI Research 提出 ABBEL 框架,将摘要的信息内容隔离并以自然语言"信念状态"(belief states)形式进行监督,用信念替代完整交互历史作为智能体的工作上下文,并通过信念评分提升性能。该方法针对递归摘要(即上下文压缩)在长程任务中性能损失显著的问题,尤其适用于协作代码生成等高质量数据稀缺的人类辅助场景。

7月7日周二
4月20日周一
  1. Berkeley AI Research36

    GRASP:面向世界模型长时程规划的梯度规划器

    Berkeley AI Research 提出 GRASP,一种面向学习动力学(世界模型)的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接加入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度,使长时程规划更实用、更稳健。