跳到正文
今天10月8日周四1 条
  1. Google Research71

    Google Research 三个月实验:AI 辅助提升专利撰写产出,但未加速初级律师判断力成长

    Google Research 在 NBER 发布三个月实地实验,将当时未发布的 Google Labs AI 专利撰写助手(现属 Gemini Notebook)随机开放给 11 家知识产权律所的 133 名律师。

    推荐理由:三个月专利撰写实验区分了AI带来的即时产出提升与无辅助判断力的变化,为理解AI对专业能力的影响提供了实证。

10月7日周三
  1. 东方财富研报·行业22

    毕马威《2026决策优势》:人工智能如何为财务职能创造价值

    毕马威发布《2026决策优势》报告,基于对13个行业、20个国家共1,013位高级财务领导人的调查,将AI研究范围从财务报告扩展至治理、控制和劳动力等整个财务职能。报告指出,AI成熟度正超越企业将其转化为绩效的运营能力,进展最快的组织把治理、控制和人工监督等信任要素视为构建绩效的一部分,而非合规成本,这也是KPMG可信人工智能框架的核心。

  2. Google Research62

    Google Earth AI 的 PDFM 地理空间基础模型在五项全球公共卫生任务中的验证

    Google Research 发布研究,用 Google Earth AI 的 Population Dynamics Foundation Model(PDFM)作为概念验证,展示自监督预训练的“地点”表征可作为即插即用输入接入现有流行病学模型,无需任务特定微调。

    推荐理由:Google 用五个公共卫生案例验证地理空间基础模型嵌入可直接接入现有流行病学流程,读者可了解其验证范围与量化增益。

10月6日周二
10月5日周一
  1. Simon Willison22

    Qwen3.8 27B 用英文单词做加法的基准测试

    Simon Willison 在 DGX Spark 上测试本地 Qwen3.8-27B-Q4_K_M.gguf 能否仅用英文单词表达整数加法结果,禁用推理时 5,070 个用例的数值准确率为 23.57%,格式合规率 96.17%,但准确率从一至三位数的 97.04% 降至十至十三位数的 6.44%。启用推理后,169 个配对用例中答对 167 个。

10月4日周日
  1. Hugging Face Blog62

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再根据其留下的后端终态和副作用打分,而非看模型生成的文字。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定任务成败,并给出可复现的 OpenEnv 运行方式。

10月2日周五
  1. Google Research62

    Google 发布基于 TEE 的新一代联邦学习系统

    Google Research 公布新一代联邦学习系统,用可信执行环境(TEE)为数据匿名化提供可远程验证和审计的保证,并已由 Gboard 采用。系统通过访问策略公开透明日志、KMS 密钥管理与可复现构建,使加密训练数据只能在符合策略的 TEE 内解密处理。Gboard 已用该系统上线英语和日语下一词预测模型,训练时间从此前的 1-2 个月缩短,目前主要受 TEE 资源限制。

    推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的落地情况,可了解隐私可验证训练的实现路径。

  2. Hugging Face Blog38

    ServiceNow CoreAI 推出 AutoSynthData:为企业智能体生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功示范,定位能力缺口并生成、验证新的可执行训练任务,随模型提升动态调整课程。该流程在 EnterpriseOps Gym 数据集上进行了演示,生成的任务需满足可行性、真实性与难度三项要求,并通过一致性、可靠性与完备性的验证器筛选后用于后训练。

10月1日周四
9月30日周三
  1. Google Research42

    Google Research 提出 Diffusion Controller:统一并简化 AI 图像生成控制

    Google Research 提出 Diffusion Controller 框架,将扩散模型去噪过程重构为连续控制问题,通过轻量级“转向阻尼”网络在不改动冻结基座模型的情况下动态调整生成轨迹。在 Stable Diffusion v1.4 上以 HPS-v2 评测,其完全解锁版本对基线模型取得 90% 胜率,并支持黑盒、灰盒模型的微调与偏好对齐。

9月29日周二
9月25日周五
  1. Google Research66

    Google Research 提出 AI 视频联合导演框架,实现连贯长视频生成

    Google Research 发布 AI video co-director 多智能体框架,作为 Gemini 和 Veo 之上的编排层,把长视频生成建模为全局优化与世界状态跟踪问题,以缓解语义漂移和级联失败。

    推荐理由:Google 把长视频生成拆成四个可组合框架,并给出多镜头一致性与分钟级生成的评测结果。

9月24日周四
  1. Microsoft Research62

    微软研究院:将物理 AI 推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU 可提升任务表现。

    推荐理由:微软研究院系统测量了机器人端侧 GPU 推理的性能与续航代价,并给出可复用的卸载工具链,为物理 AI 推理架构提供实测依据。

9月21日周一
9月19日周六
9月18日周五
9月16日周三
9月11日周五
9月7日周一
8月13日周四
  1. Microsoft Research38

    MindTopo:微软推出评估多模态模型拓扑推理能力的新基准

    微软研究院推出 MindTopo 基准,用于评估多模态大语言模型在连通性、封闭性、顺序、分离和绳结五类拓扑关系上的推理与规划能力。测试显示,当前专有与开源模型在静态识别上明显强于交互式规划,且均远低于人类水平,失败多出现在规划阶段而非感知阶段。图像与视频生成仅在单帧关系可见时偶有帮助,跨多步操作时仍不可靠。

7月29日周三
7月26日周日
  1. Berkeley AI Research42

    Berkeley AI Research 提出 ABBEL:用信念状态替代递归摘要,提升 LLM 长程交互效率

    Berkeley AI Research 提出 ABBEL 框架,将摘要的信息内容隔离并以自然语言"信念状态"(belief states)形式进行监督,用信念替代完整交互历史作为智能体的工作上下文,并通过信念评分提升性能。该方法针对递归摘要(即上下文压缩)在长程任务中性能损失显著的问题,尤其适用于协作代码生成等高质量数据稀缺的人类辅助场景。

4月20日周一
  1. Berkeley AI Research36

    GRASP:面向世界模型长时程规划的梯度规划器

    Berkeley AI Research 提出 GRASP,一种面向学习动力学(世界模型)的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接加入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度,使长时程规划更实用、更稳健。

3月13日周五
  1. Berkeley AI Research38

    Berkeley AI Research 提出 SPEX 与 ProxySPEX:大规模识别 LLM 交互关系

    Berkeley AI Research 提出 SPEX 和 ProxySPEX 算法,用于在大规模 LLM 中识别关键交互关系。方法以消融为核心,通过移除输入提示词的特定片段并测量预测变化来实现特征归因。随着特征、训练数据和模型组件数量增长,潜在交互数量呈指数级上升,穷举分析在计算上不可行。

1月10日周六
  1. Berkeley AI Research22

    伯克利提出信息驱动成像系统设计框架,NeurIPS 2025 论文验证四大成像领域

    伯克利 AI 研究团队提出一种基于信息量的成像系统评估与优化框架,仅用含噪测量和噪声模型即可量化测量对物体的区分能力。该框架在四个成像领域预测系统性能,优化后的设计可媲美端到端 SOTA 方法,且内存和算力需求更低,无需任务专用解码器设计。相关成果发表于 NeurIPS 2025。