Microsoft 研究员 Jennifer Neville:AI 评测如何暴露传统 benchmark 之外的“意外失败”
Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统性能边界,以及模型在传统 benchmark 之外测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细检查数据。
Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统性能边界,以及模型在传统 benchmark 之外测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细检查数据。
Import AI 474 期关注 Michael Levin 提出的"柏拉图式心智空间"假说,认为心智是非物理模式,身体与机器只是其进入物理世界的接口。同期内容还涉及在太空部署 TPU,以及智谱(Zhipu)启动外层 RSI 循环。
RAND 发布报告提出美国应以"自由行动"战略应对超级智能,核心是保留选项而非锁定单一路线,并归纳了共存、拒止、加速三大类共七种原型策略及五项关键不确定性。研究人员还在脑组织被刻意清除的幼鼠体内培育出部分人脑组织,将其作为潜在实验平台。