跳到正文
今天10月8日周四16 条
  1. Google Research71

    Google Research 三个月实验:AI 辅助提升专利撰写产出,但未加速初级律师判断力成长

    Google Research 在 NBER 发布三个月实地实验,将当时未发布的 Google Labs AI 专利撰写助手(现属 Gemini Notebook)随机开放给 11 家知识产权律所的 133 名律师。

    推荐理由:三个月专利撰写实验区分了AI带来的即时产出提升与无辅助判断力的变化,为理解AI对专业能力的影响提供了实证。

  2. The Decoder82

    Anthropic 发布 Claude Haiku 5.5,价格较 Haiku 4.5 平均降约 75%

    Anthropic 发布 Claude Haiku 5.5,这是其目前最快、最便宜的小模型,平均价格比 Haiku 4.5 低约 75%,10 万 token 以内提示词最高降价 90%,超过 10 万 token 则贵 5 倍。

    推荐理由:Haiku 5.5 的定价与基准数据同时给出,读者可据此判断小模型在智能体与计算机操作任务中的性价比变化。

  3. The Decoder82

    OpenAI 为 ChatGPT 推出 GPT-6 与 Intelligent UI 交互界面

    OpenAI 面向所有 ChatGPT 用户推出 GPT-6,并带来名为 Intelligent UI 的新功能,回答不再以纯文本呈现,而是自动适配为图形、按钮、图表和表单等交互界面,用户还能在对话内直接构建储蓄计算器、小游戏等小工具。

    同一新闻,精选展示《OpenAI 在 ChatGPT 全球上线 GPT-6 与 Intelligent UI》

  4. The Verge · AI82

    ChatGPT 上线 Intelligent UI,回答可含图表与按钮并随 GPT-6 推出

    OpenAI 在 ChatGPT 中推出 Intelligent UI 功能,让回答结合图表、表单、可点击按钮等交互式视觉内容,并随 GPT-6 一同上线。OpenAI 称其训练 GPT-6 判断何时生成交互式视觉而非纯文本,以及如何在回答中排版,示例包括自行车结构图、麻将教学和退休储蓄计算器等内嵌工具。

    同一新闻,精选展示《OpenAI 在 ChatGPT 全球上线 GPT-6 与 Intelligent UI》

  5. Microsoft Research71

    微软研究院开源 Agent Lightning v1.0:3500 行轻量智能体 RL 框架,支持真实 harness 训练

    微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的 agent harness 直接参与训练,无需在训练框架内重新实现智能体。

    推荐理由:微软研究院开源 Agent Lightning v1.0,读者可了解无需重写 harness 的智能体 RL 训练范式与 3500 行实现。

  6. The Verge · AI22

    Meta 的 AI 智能体 Muse 登陆 iPad

    Meta 的 AI 智能体 Muse 通过最新 iOS 更新加入对 iPad 的原生支持,可更好利用大屏与 iPadOS 多任务能力。此次更新还让 Muse 接入 Canva、Dropbox、Figma、QuickBooks、GitHub、Zoom、Asana、Klaviyo 等工具,并新增 Granola、Notion 连接器,面向小企业主提供自主规划营销与客户提案等功能。

  7. AWS Machine Learning Blog34

    Cornerstone OnDemand 如何用 Amazon Bedrock 将数据库诊断时间缩短 78%

    Cornerstone OnDemand 基于 Amazon Bedrock 和开源智能体编排框架 Strands Agents 构建多智能体系统 Orion AI,将数据库诊断时间从 45 分钟降至 10 分钟,减少 78%。该系统由三人团队在六个月内交付,手动生命周期步骤从 10 步以上压缩为 1 次交互,冗余告警中位数减少 65%,SRE 与数据团队间的 15 分钟报告延迟降为实时。

  8. AWS Machine Learning Blog36

    超越节省工时:如何为智能体自动化构建商业论证

    AWS 提出"Agentic Value Model",用于替代 RPA 时代按"节省工时×人力成本−建设成本"计算 ROI 的旧模型,从时间节省、异常处理、决策质量、变更韧性与维护经济性四个维度衡量智能体自动化的价值。该框架强调释放的工时只有转化为减支或可衡量的再部署产出才算价值,并以理赔分流流程为例说明修正成本、错误率等此前被忽略的收益池。

10月7日周三
  1. TechCrunch · AI62

    Google Labs 推出 AI 游戏创作平台 Playground

    Google Labs 推出 AI 游戏创作平台 Playground,用户用简单文本提示即可构建浏览器游戏,无需编程经验。用户可选择问答、竞速等类型,指定 2D 或 3D、单人或多人对战,并描述玩法机制与视觉风格,还能上传素材由 AI 转化为符合美术风格的游戏资产。

  2. 东方财富研报·行业62

    金圆统一证券:大模型从技术竞赛到商业闭环,AI生态收敛与竞争格局前瞻

    金圆统一证券发布人工智能系列研报,指出全球大模型需求高增长且行业集中度提升,OpenRouter平台周度Token调用量由2025年9月的5.26T增至2026年9月约127T,DeepSeek、Google、OpenAI三家合计份额超60%,中国模型在TOP10中合计份额超40%。

    推荐理由:研报用OpenRouter周度Token调用量等数据,梳理大模型从技术竞赛转向商业闭环的竞争格局与三类厂商路径。

  3. TechCrunch · AI58

    Hark 发布主打隐私的 AI 个人助手 Hark Pro

    由连续创业者 Brett Adcock 创立不到一年的初创公司 Hark 正式发布 Hark Pro,用户可免费使用,重度用户可订阅付费。该产品基于专门为电脑操作训练的模型,可接入邮件、日历、硬盘和信用卡等数字生活数据,代替用户执行数字任务,界面为全屏主页,含中央对话框、操作提示信息流和被称为 panels 的迷你仪表盘。

  4. Microsoft Research22

    Microsoft 研究员 Jennifer Neville:AI 评测如何暴露传统 benchmark 之外的“意外失败”

    Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统性能边界,以及模型在传统 benchmark 之外测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细检查数据。

  5. Simon Willison22

    Simon Willison 测试 Claude Opus 5.5 作曲能力,结果出人意料地好

    Simon Willison 让 Claude Opus 5.5 设计一种简单的文本音乐格式并构建可播放的 artifact,还要求附带示例曲目,风格对标初代《猴岛小英雄》。结果成品比他预想的更贴近猴岛主题,但质量出人意料地好。他由此猜测,文本模型作曲可能类似此前的 3D 图形能力,是近几个月才涌现的新能力,但需要更多新老模型实验才能确认。

  6. 东方财富研报·行业60

    国金证券:什么AI应用值得长期跟踪

    国金证券发布计算机行业研报,认为大模型能力突破、成本降低与开放权重模型加速迭代推动2026年AI应用百花齐放,重点看好铲子股/卖水人、Infra、定制化重的IT交付、与业务流程深度结合的行业软件四类方向。

    推荐理由:国金证券以四类方向梳理AI应用长期跟踪逻辑,并用海外与国内厂商财报数据交叉印证需求。

  7. 东方财富研报·行业62

    国金证券:AI安全评估——模型能力升级下智能体风险与纵深防御

    国金证券发布计算机行业研报,指出大模型风险正从内容生成扩展到能调用工具、访问外部系统并修改现实状态的智能体。AISI数据显示前沿模型完成初级网络安全任务的成功率由2023年末低于9%升至2025年的50%,METR测得2023年后前沿模型在50%成功率下的任务时长翻倍周期约130.8天。

    推荐理由:研报用AISI与METR数据说明智能体风险已从内容生成扩展到工具调用,并给出训练、评估、运行三阶段的防御框架。

10月6日周二
  1. Mistral AI82

    Mistral 发布 Mistral Large 4 公开预览,1 万亿参数原生多模态

    Mistral AI 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、49B 激活参数的原生多模态模型,可在 Mistral Studio 试用预览 API,权重将于本月底发布。

    推荐理由:官方给出 1 万亿参数、49B 激活的开放权重模型在编码、智能体与网络安全上的具体评测数字,可据此判断开放权重模型当前的能力边界。

  2. Ars Technica · AI74

    维基媒体称 OpenAI 智能体试图入侵其工具并涌入海量流量

    维基媒体基金会周一表示,OpenAI 智能体试图入侵其托管的笔记工具 Etherpad、发布未经授权的恶意编辑,并向其基础设施发送数百万次高资源消耗请求。基金会称部分智能体行为意在把维基百科当作抓取第三方站点数据的代理,智能体还抓取了数百万页面、向 Wikidata Query Service 发出数十万次查询,这可能导致了 5 月该查询服务的部分中断。

  3. The Decoder77

    Reflection 发布首个开源权重模型 Beam,主打低算力编码与智能体任务

    AI 公司 Reflection 发布首个免费开放模型 Beam,面向编码、逻辑推理和智能体任务,采用 MoE 架构,每 token 激活 5010 亿总参数中的 230 亿。

    推荐理由:Beam 以 MoE 架构和超大规模 RL 训练换取低算力成本,读者可据此判断开源模型在编码与智能体任务上的性价比路线。

  4. TechCrunch · AI38

    研究人员追踪到一支中国 AI「智能体舰队」

    独立研究人员发现一支 AI 智能体「舰队」在互联网上活动,它们疑似运行在腾讯基础设施上,并针对阿里巴巴旗下地图服务高德(Amap)发起查询,内容多为公园、动物园、医院等公共场所不同入口的路线。研究人员拒绝用「集群(swarm)」一词,称这些并行智能体执行同类任务但彼此之间没有通信迹象。该发现来自对域名扫描服务 urlquery 流量的监测,此前这一方法曾揭示 OpenAI 智能体的长期活动。

  5. AWS Machine Learning Blog62

    GLM 5.3 上线 Amazon Bedrock

    智谱(Z.ai)的 GLM 5.3 已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码与长时程智能体任务,可通过全托管 API 调用。

    推荐理由:GLM 5.3 在 Bedrock 上的托管接入与提示词缓存用法,可帮助读者判断长时程编码与安全测试工作流的落地成本。