Google Research 三个月实验:AI 辅助提升专利撰写产出,但未加速初级律师判断力成长
Google Research 在 NBER 发布三个月实地实验,将当时未发布的 Google Labs AI 专利撰写助手(现属 Gemini Notebook)随机开放给 11 家知识产权律所的 133 名律师。
推荐理由:三个月专利撰写实验区分了AI带来的即时产出提升与无辅助判断力的变化,为理解AI对专业能力的影响提供了实证。
Google Research 在 NBER 发布三个月实地实验,将当时未发布的 Google Labs AI 专利撰写助手(现属 Gemini Notebook)随机开放给 11 家知识产权律所的 133 名律师。
推荐理由:三个月专利撰写实验区分了AI带来的即时产出提升与无辅助判断力的变化,为理解AI对专业能力的影响提供了实证。
Amazon Quick 与 Amazon Bedrock Knowledge Bases 在预检索 ACL 过滤之上新增实时 ACL 校验,在查询时直接向权威数据源核验权限,避免依赖可能过期或映射错误的 ACL 数据。
AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用。
推荐理由:文章给出 Haiku 5.5 在 Bedrock 上的能力定位与调用方式,可据此判断它在多智能体分工中的成本位置。
OpenAI 宣布 GPT-6 正在 ChatGPT 中面向全球上线,并同步推出 Intelligent UI。官方称其响应更快,并带来可视化与可直接探索使用的交互体验。
推荐理由:OpenAI 官方公布 GPT-6 在 ChatGPT 全球上线,并同步带来 Intelligent UI 的交互变化。
NVIDIA 与 Microsoft 在旧金山 Windows AI 活动上宣布为 Windows PC 的 AI 智能体共同设计软硬件,Microsoft 宣布操作系统级基础设施 Microsoft Execution Containers(MXC)正式可用,让智能体在系统控制下安全持久地在后台运行。
推荐理由:NVIDIA 与 Microsoft 把智能体运行所需的系统级容器和本地算力硬件一并给出,可据此判断本地智能体的落地路径。
Radisson Hotel Group 与 Accenture 合作,基于 OpenAI 技术打造了一款 ChatGPT 插件,帮助旅客在规划行程时查找、比较和预订酒店。
GitHub 发布基于 ModernBERT 的通用密钥检测分类器,利用上下文在 2 毫秒内评估候选密钥,可将可拦截的密钥数量提升一倍以上。
推荐理由:GitHub 公开九季度密钥泄露数据,并说明新分类器如何把推送拦截扩展到非结构化密钥。
Liquid AI 发布 d1 决策模型家族的两款开源模型 d1-3B 和 d1-omni-600M(实验性),均基于其 LFM 构建,不生成 token 而是在单次前向传播中给出答案。
推荐理由:Liquid AI 开源两款决策模型,给出决策质量、端侧延迟与多模态输入的具体数据,可据此判断边缘场景的可用性。
微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的 agent harness 直接参与训练,无需在训练框架内重新实现智能体。
推荐理由:微软研究院开源 Agent Lightning v1.0,读者可了解无需重写 harness 的智能体 RL 训练范式与 3500 行实现。
Cornerstone OnDemand 基于 Amazon Bedrock 和开源智能体编排框架 Strands Agents 构建多智能体系统 Orion AI,将数据库诊断时间从 45 分钟降至 10 分钟,减少 78%。该系统由三人团队在六个月内交付,手动生命周期步骤从 10 步以上压缩为 1 次交互,冗余告警中位数减少 65%,SRE 与数据团队间的 15 分钟报告延迟降为实时。
AWS 提出一套六周结构化培养方案,让非工程背景的业务人员用 Amazon Bedrock AgentCore、Strands Agents SDK 等工具构建可扩展的 AI 原型。
AWS 展示了一套自动化修复工作流,用 Amazon EventBridge 接收 AWS DevOps Agent 的调查完成事件,再由 AWS Lambda Durable Functions 调用 Amazon Bedrock 分析根因并从预批准的 Lambda 工具白名单中选择修复动作。
Qlik 基于 Amazon Bedrock 打造 Qlik Answers,让员工用自然语言提问并获得带来源的可信回答,自 2026 年 2 月正式可用以来,其 Discovery Agent 已为客户发现超过 10 万个异常与离群点。
AWS 提出"Agentic Value Model",用于替代 RPA 时代按"节省工时×人力成本−建设成本"计算 ROI 的旧模型,从时间节省、异常处理、决策质量、变更韧性与维护经济性四个维度衡量智能体自动化的价值。该框架强调释放的工时只有转化为减支或可衡量的再部署产出才算价值,并以理赔分流流程为例说明修正成本、错误率等此前被忽略的收益池。
OpenAI 将 College Planner 引入 ChatGPT for Teens,帮助学生管理大学申请,同时上线新的 flashcards 和 quizzes 功能。OpenAI 还宣布成立青少年 AI 委员会(teen AI council),让青少年参与塑造 AI 的未来。
英伟达团队从 Nemotron 3 出发,用 SFT、RL 和生成-验证-精炼推理流程,让模型在 IOI 2026 拿到 535.4/600、在 IMO 2026 拿到 30/42,均超过官方金牌线。
推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可复用到其他高难领域。
OpenAI 发布内部前沿模型在数学开放问题上的新结果,并在 GitHub 公开 Lean 证明形式化与研究细节。
推荐理由:OpenAI 公开内部前沿模型在数学开放问题上的结果与 Lean 形式化证明,可了解其研究路径。
Jump Trading 正借助 OpenAI 扩展量化研究,通过运行时间更长的 AI 工作流整合多个数据源,并保留人工审核环节。
基于开源智能体系统 OpenClaw 与 Amazon Bedrock AgentCore runtime,可搭建具备长期记忆的个人 AI 助手,用 AgentCore memory 把一次性对话转为持久知识,并支持结构化元数据检索。
Google DeepMind 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、Apache 2.0 许可的开源多模态嵌入模型,参数量 740M,可将文本、图像、音频、视频映射到统一嵌入空间。
推荐理由:官方给出参数量、分模块编码器与端侧内存占用,可据此判断本地多模态检索的落地成本。
OpenAI 与 Ironclad 正围绕复杂的合同工作流训练和评估 AI 智能体,以推进面向专业工作的计算机操作能力。双方将合同流程作为测试场景,探索智能体在真实专业任务中的表现。
Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统性能边界,以及模型在传统 benchmark 之外测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细检查数据。
Atlassian 与 OpenAI 扩大合作,把前沿模型与企业知识连接起来,帮助团队规划、构建和交付工作。双方未披露具体模型版本、接入产品或上线时间等细节。
基于 Amazon Bedrock AgentCore、Amazon Nova 2.5 Sonic 与 Bedrock Knowledge Bases,可在航空公司应用中搭建语音旅行礼宾:旅客通过语音查询行程、改座位、更新餐食偏好、咨询政策,并可转接人工客服。
Amazon SageMaker 推出新功能,数据科学家和 ML 工程师可直接在 SageMaker Studio UI 中创建、配置、启停和打开 HyperPod EKS 集群上的 Spaces,无需使用 CLI 或 kubectl。
AWS 介绍如何通过 SageMaker Unified Studio 管理 SageMaker HyperPod 集群,在让 ML 团队从项目工作区启动负载的同时保留底层治理控制。
Google Research 发布研究,用 Google Earth AI 的 Population Dynamics Foundation Model(PDFM)作为概念验证,展示自监督预训练的“地点”表征可作为即插即用输入接入现有流行病学模型,无需任务特定微调。
推荐理由:Google 用五个公共卫生案例验证地理空间基础模型嵌入可直接接入现有流行病学流程,读者可了解其验证范围与量化增益。
AWS 发文解读国际标准 ISO/IEC 42005:2025,说明企业如何将 AI 系统影响评估整合进整体风险治理体系。该标准覆盖评估全生命周期(范围界定与执行、分析与报告、持续监控与复审),并提供 Annex D 复用既有评估流程、Annex E 独立评估模板两套方案,还给出轻量级评估分诊方法以判断是否需要完整评估。
Mistral AI 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、49B 激活参数的原生多模态模型,可在 Mistral Studio 试用预览 API,权重将于本月底发布。
推荐理由:官方给出 1 万亿参数、49B 激活的开放权重模型在编码、智能体与网络安全上的具体评测数字,可据此判断开放权重模型当前的能力边界。
NVIDIA《State of AI in Telecommunications》报告显示,89% 受访者认为开源模型与软件对公司 AI 战略重要。NVIDIA 发布 300 亿参数的 Nemotron 3 Large Telco Model(LTM),由 AdaptKey 基于开源电信数据集微调,并开放端到端微调配方,配合 NeMo 库供运营商用自有数据定制。
基于 Falcon-H1-Arabic 的方言专用模型 Falcon-Emirati-7B 发布,专注理解与生成阿联酋阿拉伯语,涵盖词汇、语气与文化语境。
智谱(Z.ai)的 GLM 5.3 已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码与长时程智能体任务,可通过全托管 API 调用。
推荐理由:GLM 5.3 在 Bedrock 上的托管接入与提示词缓存用法,可帮助读者判断长时程编码与安全测试工作流的落地成本。
Google 发布《Open and Emergent Problems in Agentic Privacy and Security: A Contextual Angle》报告,由 50 多位学界与业界人士在 2025 年底纽约 CAPS workshop 上协作完成。
Anthropic 的 Claude Opus 5.5、Claude Sonnet 5.5 与 Claude Sonnet 5 已在 AWS GovCloud (US) 区域的 Amazon Bedrock 上线,为 ITAR 等受监管工作负载提供 AI 辅助开发通道。
Amazon SageMaker AI 通过 Agent Toolkit for AWS 推出 aws-ai-ml 技能,让 Kiro、Claude Code、Codex 等支持 MCP 的编码智能体获得推理优化与基准测试能力,可对端点做基准测试、推荐部署配置、对比性能并生成可执行的 SageMaker Python SDK v3 代码。
GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 19 种语言的 219 个公开 pull request。
推荐理由:GitHub 公开了代码审查基准的构建方法与评分口径,读者可据此理解 AI 代码审查评测的取舍。
Amazon Quick 的 Quick Resource Migrator 是一个托管在 Amazon Bedrock AgentCore 上的 MCP server,可通过单次工具调用将 chat agents、action connectors、知识库、flows 和 spaces 从开发账户迁移到生产账户。
Amazon Bedrock Managed Knowledge Base 上线智能体检索,通过 AgenticRetrieveStream API 把多部分问题拆成子查询、判断证据是否充分并决定是否再次检索,而 Retrieve API 只做一次混合搜索。
Amazon Quick 控制台不支持将用户从 Admin 或 Author 直接降级为 Reader,update-user API 也会以“You cannot downgrade a user role”报错拒绝。
Amazon Bedrock AgentCore Evaluations 支持内置与自定义评估器,可衡量多智能体系统的准确性、任务成功率和行为表现,并将可解释性作为一等评估维度。