Google 向公众开放 SynthID 检测器,称已有 1800 亿图片和视频带水印
Google 将 SynthID Detector 开放给公众,任何人都可以检查图片、视频或音频是否由其 AI 或合作方生成,支持 JPG、PNG、MP4 和 MP3 格式。
Google 将 SynthID Detector 开放给公众,任何人都可以检查图片、视频或音频是否由其 AI 或合作方生成,支持 JPG、PNG、MP4 和 MP3 格式。
Liquid AI 发布 d1 决策模型家族的两款开源模型 d1-3B 和 d1-omni-600M(实验性),均基于其 LFM 构建,不生成 token 而是在单次前向传播中给出答案。
推荐理由:Liquid AI 开源两款决策模型,给出决策质量、端侧延迟与多模态输入的具体数据,可据此判断边缘场景的可用性。
Google 发布浏览器端 AI 平台 Playground,美国成年用户无需编程,仅靠文本输入即可创建游戏,并通过与 AI 多轮对话调整规则、物理、角色和环境,随后即时测试。
Google 上线新网站,任何人都可以验证图片、视频或音频是否由 AI 生成。该工具此前仅向部分记者、媒体从业者和研究人员开放测试,现已向所有人开放,支持 JPG、PNG、MP4、MOV、WAV、MP3 等图像、视频和音频格式。
Google 发布开源多模态嵌入模型 EmbeddingGemma 2,可将文本、图像、视频、音频和代码转换为数值向量,参数量 7.4 亿。Google 称其在多模态嵌入基准上超过参数量最多两倍的竞品,在 Massive Text Embedding Benchmark (Code) 上得分 78.68,比前代 68.76 提升近 10 分。
Simon Willison 用 llm 命令行工具让 Mistral Large 4(mistral/mistral-large-4)生成“火星上穿网袜乱穿马路的犰狳”SVG,并与 claude-opus-5.5、gpt-6.1-sol、gemini-3.8-flash 对比,各模型均使用默认推理等级。此举源于 wren6991 关于基准测试已饱和、前沿模型只能靠荒诞题目区分的评论。
Google DeepMind 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、Apache 2.0 许可的开源多模态嵌入模型,参数量 740M,可将文本、图像、音频、视频映射到统一嵌入空间。
推荐理由:官方给出参数量、分模块编码器与端侧内存占用,可据此判断本地多模态检索的落地成本。
Mistral 发布迄今最大模型 Mistral Large 4(ML4),拥有 1 万亿参数、490 亿激活参数,原生多模态,已在 Mistral Studio 开放 API 预览,权重预计 10 月底发布。
法国 AI 实验室 Mistral AI 发布大模型 Mistral Large 4(ML4),这是一个 1 万亿参数的多模态模型,因参数量被昵称为 Le Chonk。
Pinterest 推出 Beauty Guides,依托其视觉智能与生成式 AI 技术 Pinterest Intelligence,把发型、发色、美甲等美妆类 Pin 转成可带去沙龙的行动方案。
Mistral AI 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、49B 激活参数的原生多模态模型,可在 Mistral Studio 试用预览 API,权重将于本月底发布。
推荐理由:官方给出 1 万亿参数、49B 激活的开放权重模型在编码、智能体与网络安全上的具体评测数字,可据此判断开放权重模型当前的能力边界。
Reka AI 发布研究预览版 Rho-1,这是一个 190 亿参数的全能模型,可在单一神经网络中处理并生成文本、图像、视频和机器人控制动作。与多数将任务分派给专用模型的系统不同,Rho-1 把所有模态作为 token 放在同一个共享上下文窗口中运行,无需工具调用或外部模型。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者。
推荐理由:官方披露了 Argon 在编码、企业知识与网络安全防御上的能力与定价,可据此判断前沿模型的分阶段开放路径。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据联合训练的生物学世界模型,以及连接模型、科学工具、文献与研究者的交互式 harness 组成。
推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环,并给出胰腺癌化合物筛选的湿实验验证结果。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音结合,为 Gemini 的实时对话模型加入动态视觉形象,具备精准唇形同步、自然表情和流畅轮次切换。
推荐理由:官方给出实时视频与语音耦合的对话能力、异步工具调用和 97 种语言切换等具体细节,可据此判断企业级数字人交互的落地边界。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,前者面向角色设计与逐句表演指导,后者面向高并发、低成本的配音与语音智能体。
推荐理由:官方给出两款 TTS 的定位差异、可用入口与基准排名,便于判断语音生成在创作与规模化场景的取舍。
微软研究院推出 MindTopo 基准,用于评估多模态大语言模型在连通性、封闭性、顺序、分离和绳结五类拓扑关系上的推理与规划能力。测试显示,当前专有与开源模型在静态识别上明显强于交互式规划,且均远低于人类水平,失败多出现在规划阶段而非感知阶段。图像与视频生成仅在单帧关系可见时偶有帮助,跨多步操作时仍不可靠。