Liquid AI 开源 d1-3B 与 d1-omni-600M 端侧决策模型
Liquid AI 发布 d1 决策模型家族的两款开源模型 d1-3B 和 d1-omni-600M(实验性),均基于其 LFM 构建,不生成 token 而是在单次前向传播中给出答案。
推荐理由:Liquid AI 开源两款决策模型,给出决策质量、端侧延迟与多模态输入的具体数据,可据此判断边缘场景的可用性。
方向与市场
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
7 条精选近 30 天 7 条共收录 17 条
Liquid AI 发布 d1 决策模型家族的两款开源模型 d1-3B 和 d1-omni-600M(实验性),均基于其 LFM 构建,不生成 token 而是在单次前向传播中给出答案。
推荐理由:Liquid AI 开源两款决策模型,给出决策质量、端侧延迟与多模态输入的具体数据,可据此判断边缘场景的可用性。
Google DeepMind 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、Apache 2.0 许可的开源多模态嵌入模型,参数量 740M,可将文本、图像、音频、视频映射到统一嵌入空间。
推荐理由:官方给出参数量、分模块编码器与端侧内存占用,可据此判断本地多模态检索的落地成本。
Mistral AI 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、49B 激活参数的原生多模态模型,可在 Mistral Studio 试用预览 API,权重将于本月底发布。
推荐理由:官方给出 1 万亿参数、49B 激活的开放权重模型在编码、智能体与网络安全上的具体评测数字,可据此判断开放权重模型当前的能力边界。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者。
推荐理由:官方披露了 Argon 在编码、企业知识与网络安全防御上的能力与定价,可据此判断前沿模型的分阶段开放路径。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据联合训练的生物学世界模型,以及连接模型、科学工具、文献与研究者的交互式 harness 组成。
推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环,并给出胰腺癌化合物筛选的湿实验验证结果。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音结合,为 Gemini 的实时对话模型加入动态视觉形象,具备精准唇形同步、自然表情和流畅轮次切换。
推荐理由:官方给出实时视频与语音耦合的对话能力、异步工具调用和 97 种语言切换等具体细节,可据此判断企业级数字人交互的落地边界。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,前者面向角色设计与逐句表演指导,后者面向高并发、低成本的配音与语音智能体。
推荐理由:官方给出两款 TTS 的定位差异、可用入口与基准排名,便于判断语音生成在创作与规模化场景的取舍。