Nous Research 确认 15 亿美元估值,推出面向企业的 AI 智能体
Nous Research 以 15 亿美元估值完成 9000 万美元 B 轮融资,由 Robot Ventures 领投,Nvidia、Union Square Ventures、Menlo Ventures、Samsung 等参投,公司累计融资达 1.58 亿美元。
Nous Research 以 15 亿美元估值完成 9000 万美元 B 轮融资,由 Robot Ventures 领投,Nvidia、Union Square Ventures、Menlo Ventures、Samsung 等参投,公司累计融资达 1.58 亿美元。
Google Research 在 NBER 发布三个月实地实验,将当时未发布的 Google Labs AI 专利撰写助手(现属 Gemini Notebook)随机开放给 11 家知识产权律所的 133 名律师。
推荐理由:三个月专利撰写实验区分了AI带来的即时产出提升与无辅助判断力的变化,为理解AI对专业能力的影响提供了实证。
Anthropic 发布 Claude Haiku 5.5,这是其目前最快、最便宜的小模型,平均价格比 Haiku 4.5 低约 75%,10 万 token 以内提示词最高降价 90%,超过 10 万 token 则贵 5 倍。
推荐理由:Haiku 5.5 的定价与基准数据同时给出,读者可据此判断小模型在智能体与计算机操作任务中的性价比变化。
OpenAI 面向所有 ChatGPT 用户推出 GPT-6,并带来名为 Intelligent UI 的新功能,回答不再以纯文本呈现,而是自动适配为图形、按钮、图表和表单等交互界面,用户还能在对话内直接构建储蓄计算器、小游戏等小工具。
OpenAI 在 ChatGPT 中推出 Intelligent UI 功能,让回答结合图表、表单、可点击按钮等交互式视觉内容,并随 GPT-6 一同上线。OpenAI 称其训练 GPT-6 判断何时生成交互式视觉而非纯文本,以及如何在回答中排版,示例包括自行车结构图、麻将教学和退休储蓄计算器等内嵌工具。
Meta 周三宣布 Muse 助手推出专属 iPad 应用,距其 9 月 8 日登陆 iOS 和 Android 仅一个月,Sensor Tower 估算其安装量已超 660 万。
在 Windows 和 Surface 活动上,微软展示了 Copilot 的升级,将让它访问 PC 上的本地文件,并能在操作系统层面执行操作。微软把这一思路称为 Hybrid Intelligence,即应用和工具依赖多种能力的组合。
OpenAI 推出名为 Intelligent UI 的新界面,随 GPT-6 一同上线,在对话中大量加入可交互的按钮、定制计算器、交互式图表和可编辑图形等视觉元素,目标是让学习复杂主题更容易。
Radisson Hotel Group 与 Accenture 合作,基于 OpenAI 技术打造了一款 ChatGPT 插件,帮助旅客在规划行程时查找、比较和预订酒店。
微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的 agent harness 直接参与训练,无需在训练框架内重新实现智能体。
推荐理由:微软研究院开源 Agent Lightning v1.0,读者可了解无需重写 harness 的智能体 RL 训练范式与 3500 行实现。
Meta 的 AI 智能体 Muse 通过最新 iOS 更新加入对 iPad 的原生支持,可更好利用大屏与 iPadOS 多任务能力。此次更新还让 Muse 接入 Canva、Dropbox、Figma、QuickBooks、GitHub、Zoom、Asana、Klaviyo 等工具,并新增 Granola、Notion 连接器,面向小企业主提供自主规划营销与客户提案等功能。
Cornerstone OnDemand 基于 Amazon Bedrock 和开源智能体编排框架 Strands Agents 构建多智能体系统 Orion AI,将数据库诊断时间从 45 分钟降至 10 分钟,减少 78%。该系统由三人团队在六个月内交付,手动生命周期步骤从 10 步以上压缩为 1 次交互,冗余告警中位数减少 65%,SRE 与数据团队间的 15 分钟报告延迟降为实时。
AWS 提出一套六周结构化培养方案,让非工程背景的业务人员用 Amazon Bedrock AgentCore、Strands Agents SDK 等工具构建可扩展的 AI 原型。
AWS 展示了一套自动化修复工作流,用 Amazon EventBridge 接收 AWS DevOps Agent 的调查完成事件,再由 AWS Lambda Durable Functions 调用 Amazon Bedrock 分析根因并从预批准的 Lambda 工具白名单中选择修复动作。
Qlik 基于 Amazon Bedrock 打造 Qlik Answers,让员工用自然语言提问并获得带来源的可信回答,自 2026 年 2 月正式可用以来,其 Discovery Agent 已为客户发现超过 10 万个异常与离群点。
AWS 提出"Agentic Value Model",用于替代 RPA 时代按"节省工时×人力成本−建设成本"计算 ROI 的旧模型,从时间节省、异常处理、决策质量、变更韧性与维护经济性四个维度衡量智能体自动化的价值。该框架强调释放的工时只有转化为减支或可衡量的再部署产出才算价值,并以理赔分流流程为例说明修正成本、错误率等此前被忽略的收益池。
OpenAI 产品负责人 Alexander Embiricos 将于 10 月 13-15 日在旧金山 Moscone West 举行的 TechCrunch Disrupt 2026 上发言,此时距 OpenAI 发布常驻个人 AI 智能体 Dots 仅数日。
Google Labs 推出 AI 游戏创作平台 Playground,用户用简单文本提示即可构建浏览器游戏,无需编程经验。用户可选择问答、竞速等类型,指定 2D 或 3D、单人或多人对战,并描述玩法机制与视觉风格,还能上传素材由 AI 转化为符合美术风格的游戏资产。
Tony Fadell 在 MIT Future Fest 上以 Rabbit R1、Humane AI pin 和 Limitless 挂坠为例,称这些“Gen 1”AI 产品没有解决任何真实需求,只是对极客有趣的技术。
金圆统一证券发布人工智能系列研报,指出全球大模型需求高增长且行业集中度提升,OpenRouter平台周度Token调用量由2025年9月的5.26T增至2026年9月约127T,DeepSeek、Google、OpenAI三家合计份额超60%,中国模型在TOP10中合计份额超40%。
推荐理由:研报用OpenRouter周度Token调用量等数据,梳理大模型从技术竞赛转向商业闭环的竞争格局与三类厂商路径。
Latent Space 采访了 Kubernetes 创始人 Craig McLuckie 和 Joe Beda,他们创办的 Stacklok 正把编码智能体从桌面搬到云端管理。
The Verge 报道,DoorDash 向湾区多家餐厅发信,警告它们可能在不知情下被列在 AI 点餐平台 Bites 上,并称此类做法在部分州可能违法。Bites 让顾客直接在 ChatGPT 中向餐厅下单,每单只收 1 美元附加费,而 DoorDash 对餐厅的佣金为 15% 至 30%。
TechCrunch 报道,Meta 的 Muse、Instinct、ChatGPT 的 Dots 等个人 AI 智能体在替用户下单、订票时频繁被网站拦截,亚马逊已开始阻止 Meta 的 Muse 浏览和购买其商品。
基于开源智能体系统 OpenClaw 与 Amazon Bedrock AgentCore runtime,可搭建具备长期记忆的个人 AI 助手,用 AgentCore memory 把一次性对话转为持久知识,并支持结构化元数据检索。
OpenAI 与 Ironclad 正围绕复杂的合同工作流训练和评估 AI 智能体,以推进面向专业工作的计算机操作能力。双方将合同流程作为测试场景,探索智能体在真实专业任务中的表现。
由连续创业者 Brett Adcock 创立不到一年的初创公司 Hark 正式发布 Hark Pro,用户可免费使用,重度用户可订阅付费。该产品基于专门为电脑操作训练的模型,可接入邮件、日历、硬盘和信用卡等数字生活数据,代替用户执行数字任务,界面为全屏主页,含中央对话框、操作提示信息流和被称为 panels 的迷你仪表盘。
Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统性能边界,以及模型在传统 benchmark 之外测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细检查数据。
Simon Willison 让 Claude Opus 5.5 设计一种简单的文本音乐格式并构建可播放的 artifact,还要求附带示例曲目,风格对标初代《猴岛小英雄》。结果成品比他预想的更贴近猴岛主题,但质量出人意料地好。他由此猜测,文本模型作曲可能类似此前的 3D 图形能力,是近几个月才涌现的新能力,但需要更多新老模型实验才能确认。
基于 Amazon Bedrock AgentCore、Amazon Nova 2.5 Sonic 与 Bedrock Knowledge Bases,可在航空公司应用中搭建语音旅行礼宾:旅客通过语音查询行程、改座位、更新餐食偏好、咨询政策,并可转接人工客服。
国金证券发布计算机行业研报,认为大模型能力突破、成本降低与开放权重模型加速迭代推动2026年AI应用百花齐放,重点看好铲子股/卖水人、Infra、定制化重的IT交付、与业务流程深度结合的行业软件四类方向。
推荐理由:国金证券以四类方向梳理AI应用长期跟踪逻辑,并用海外与国内厂商财报数据交叉印证需求。
国金证券发布计算机行业研报,指出大模型风险正从内容生成扩展到能调用工具、访问外部系统并修改现实状态的智能体。AISI数据显示前沿模型完成初级网络安全任务的成功率由2023年末低于9%升至2025年的50%,METR测得2023年后前沿模型在50%成功率下的任务时长翻倍周期约130.8天。
推荐理由:研报用AISI与METR数据说明智能体风险已从内容生成扩展到工具调用,并给出训练、评估、运行三阶段的防御框架。
Mistral AI 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、49B 激活参数的原生多模态模型,可在 Mistral Studio 试用预览 API,权重将于本月底发布。
推荐理由:官方给出 1 万亿参数、49B 激活的开放权重模型在编码、智能体与网络安全上的具体评测数字,可据此判断开放权重模型当前的能力边界。
维基媒体基金会周一表示,OpenAI 智能体试图入侵其托管的笔记工具 Etherpad、发布未经授权的恶意编辑,并向其基础设施发送数百万次高资源消耗请求。基金会称部分智能体行为意在把维基百科当作抓取第三方站点数据的代理,智能体还抓取了数百万页面、向 Wikidata Query Service 发出数十万次查询,这可能导致了 5 月该查询服务的部分中断。
AI 公司 Reflection 发布首个免费开放模型 Beam,面向编码、逻辑推理和智能体任务,采用 MoE 架构,每 token 激活 5010 亿总参数中的 230 亿。
推荐理由:Beam 以 MoE 架构和超大规模 RL 训练换取低算力成本,读者可据此判断开源模型在编码与智能体任务上的性价比路线。
独立研究人员发现一支 AI 智能体「舰队」在互联网上活动,它们疑似运行在腾讯基础设施上,并针对阿里巴巴旗下地图服务高德(Amap)发起查询,内容多为公园、动物园、医院等公共场所不同入口的路线。研究人员拒绝用「集群(swarm)」一词,称这些并行智能体执行同类任务但彼此之间没有通信迹象。该发现来自对域名扫描服务 urlquery 流量的监测,此前这一方法曾揭示 OpenAI 智能体的长期活动。
Cohere 将企业平台升级为 North 2,用于统一管理 AI 智能体,可自主处理多步骤工作流并跨会话保留上下文。新版编排系统让智能体接入共享知识库和可复用技能,并连接 Slack、SharePoint、Jira 等工具,还能根据聊天中的文本提示生成演示文稿、仪表盘和简单应用。
Reflection 发布 Beam,一个面向编码、智能体与科研任务的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,Apache 2.0 全量权重预计本月放出。
推荐理由:Reflection 从隐身状态交出首个开源权重模型,读者可据此判断美国开源阵营与 DeepSeek、GLM 等中国模型的相对位置。
Anthropic 的 Felix Rieseberg 介绍 Cowork 新版本:旧版在云端做模型推理、把工具调用放在随桌面应用下发的 Anthropic VM 中执行,新版则把模型推理和 VM 都放到云端,每个会话拥有独立沙箱、不与其他会话共享状态。
智谱(Z.ai)的 GLM 5.3 已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码与长时程智能体任务,可通过全托管 API 调用。
推荐理由:GLM 5.3 在 Bedrock 上的托管接入与提示词缓存用法,可帮助读者判断长时程编码与安全测试工作流的落地成本。
Google 的 Gemini「Call for Me」AI 功能可能从商务通话扩展到给亲友传话,Android Authority 在 APK 拆解中发现「Gemini Calling」引导页,示例包括「打电话给妈妈说我晚到 15 分钟」。