用 Amazon Bedrock AgentCore、Managed Knowledge Base 和 Nova Sonic 构建语音旅行礼宾服务
基于 Amazon Bedrock AgentCore、Amazon Nova 2.5 Sonic 与 Bedrock Knowledge Bases,可在航空公司应用中搭建语音旅行礼宾:旅客通过语音查询行程、改座位、更新餐食偏好、咨询政策,并可转接人工客服。
基于 Amazon Bedrock AgentCore、Amazon Nova 2.5 Sonic 与 Bedrock Knowledge Bases,可在航空公司应用中搭建语音旅行礼宾:旅客通过语音查询行程、改座位、更新餐食偏好、咨询政策,并可转接人工客服。
Amazon Echo 智能音箱上的 Alexa Plus 出现 bug,会连续数分钟反复说唱“lalala”,常发生在与用户对话中途,被追问时 Alexa 对自身行为毫无察觉。该问题近几周在 Reddit 被多次报告,涉及多款 Echo 音箱,最近一次报告在三天前。亚马逊已确认这是影响“少数 Alexa Plus 用户”的 bug,正在修复。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,单模型评测耗时从数周投票缩短到数小时。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音结合,为 Gemini 的实时对话模型加入动态视觉形象,具备精准唇形同步、自然表情和流畅轮次切换。
推荐理由:官方给出实时视频与语音耦合的对话能力、异步工具调用和 97 种语言切换等具体细节,可据此判断企业级数字人交互的落地边界。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,前者面向角色设计与逐句表演指导,后者面向高并发、低成本的配音与语音智能体。
推荐理由:官方给出两款 TTS 的定位差异、可用入口与基准排名,便于判断语音生成在创作与规模化场景的取舍。
Google DeepMind 发布两款实时对话模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。
推荐理由:官方给出两款语音模型的基准成绩与开放渠道,可据此判断实时语音智能体的能力水位。