Meta 的 Muse 登陆 iPad,移动端上线仅一个月
Meta 周三宣布 Muse 助手推出专属 iPad 应用,距其 9 月 8 日登陆 iOS 和 Android 仅一个月,Sensor Tower 估算其安装量已超 660 万。
Meta 周三宣布 Muse 助手推出专属 iPad 应用,距其 9 月 8 日登陆 iOS 和 Android 仅一个月,Sensor Tower 估算其安装量已超 660 万。
Cornerstone OnDemand 基于 Amazon Bedrock 和开源智能体编排框架 Strands Agents 构建多智能体系统 Orion AI,将数据库诊断时间从 45 分钟降至 10 分钟,减少 78%。该系统由三人团队在六个月内交付,手动生命周期步骤从 10 步以上压缩为 1 次交互,冗余告警中位数减少 65%,SRE 与数据团队间的 15 分钟报告延迟降为实时。
AWS 展示了一套自动化修复工作流,用 Amazon EventBridge 接收 AWS DevOps Agent 的调查完成事件,再由 AWS Lambda Durable Functions 调用 Amazon Bedrock 分析根因并从预批准的 Lambda 工具白名单中选择修复动作。
Qlik 基于 Amazon Bedrock 打造 Qlik Answers,让员工用自然语言提问并获得带来源的可信回答,自 2026 年 2 月正式可用以来,其 Discovery Agent 已为客户发现超过 10 万个异常与离群点。
TechCrunch 报道,Meta 的 Muse、Instinct、ChatGPT 的 Dots 等个人 AI 智能体在替用户下单、订票时频繁被网站拦截,亚马逊已开始阻止 Meta 的 Muse 浏览和购买其商品。
基于 Amazon Bedrock AgentCore、Amazon Nova 2.5 Sonic 与 Bedrock Knowledge Bases,可在航空公司应用中搭建语音旅行礼宾:旅客通过语音查询行程、改座位、更新餐食偏好、咨询政策,并可转接人工客服。
Cohere 将企业平台升级为 North 2,用于统一管理 AI 智能体,可自主处理多步骤工作流并跨会话保留上下文。新版编排系统让智能体接入共享知识库和可复用技能,并连接 Slack、SharePoint、Jira 等工具,还能根据聊天中的文本提示生成演示文稿、仪表盘和简单应用。
独立研究者 Syed Anas Mohiuddin 测试了 Google、摩根大通、Weaviate、Rapid7、法国政府部际数字事务局和美国联邦政府的智能体,利用 MCP(Model Context Protocol)中的信任缺口实现概念验证攻击。
Amazon SageMaker AI 通过 Agent Toolkit for AWS 推出 aws-ai-ml 技能,让 Kiro、Claude Code、Codex 等支持 MCP 的编码智能体获得推理优化与基准测试能力,可对端点做基准测试、推荐部署配置、对比性能并生成可执行的 SageMaker Python SDK v3 代码。
Amazon Quick 的 Quick Resource Migrator 是一个托管在 Amazon Bedrock AgentCore 上的 MCP server,可通过单次工具调用将 chat agents、action connectors、知识库、flows 和 spaces 从开发账户迁移到生产账户。
Amazon Bedrock AgentCore Evaluations 支持内置与自定义评估器,可衡量多智能体系统的准确性、任务成功率和行为表现,并将可解释性作为一等评估维度。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再根据其留下的后端终态和副作用打分,而非看模型生成的文字。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定任务成败,并给出可复现的 OpenEnv 运行方式。
AWS 提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面提问合规问题,实际判定交由确定性规则引擎完成,模型只负责把自然语言转为固定类型化操作调用并复述结果。
Earendil 旗下 Pi 发布 1.0 与 Pi Durable 两个版本,同时登上 Hacker News 首页。Pi 1.0 带来 Codemode(原生支持 MCP、Jev 和图像模型)、虚拟模型扩展、延迟工具加载、Anthropic 模型缓存预热、对话中途系统消息、新 TUI 主题和默认全屏模式。
Hugging Face 发布论文 ProvenanceGuard,一种面向 MCP 智能体的来源感知事实核查层,专门检测"跨来源混淆"——即内容属实但被归因到错误来源的表述。
GitHub Copilot 应用中的 canvas 是一种可自定义的双向界面,用户只需在 agent 会话中输入 /create-canvas 并用自然语言描述需求,即可生成看板、发布清单或仪表盘等工具,无需编写代码。canvas 会保存为扩展,可随项目共享或作为个人扩展复用,社区已在 Awesome Copilot 分享发布说明、看板、issue 分诊等现成扩展。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做定级并生成漏洞报告。
推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃定级交给 LLM 智能体,读者可据此判断自动化安全测试的边界。
GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分配;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是智能体连接工具与数据的标准,二者可组合使用;RAG 并未消亡,它为模型提供训练数据之外的相关信息,能减少 token 消耗并让回答更有依据。
Google Research 提出 ToolGrad,一种“先答案后问题”的工具调用数据生成范式:先生成真实工具调用链,再反向标注用户提示词,只需一步 LLM 调用。