Microsoft 研究员 Jennifer Neville:AI 评测如何暴露传统 benchmark 之外的“意外失败”
Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统性能边界,以及模型在传统 benchmark 之外测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细检查数据。
Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统性能边界,以及模型在传统 benchmark 之外测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细检查数据。
OpenAI 探讨先进 AI 为何可能对突破性创意背后的日常执行工作最为关键。文章认为,执行环节或将决定下一阶段经济的形态与进步速度。
GitHub 认为 chat 并非与 LLM 交互的最佳界面,其 GitHub Copilot app 推出 canvas——一种运行在应用内、无浏览器外壳的全栈小应用,可与 Copilot agent 双向通信,也能调用第三方 API 并在本地执行代码。
GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分配;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是智能体连接工具与数据的标准,二者可组合使用;RAG 并未消亡,它为模型提供训练数据之外的相关信息,能减少 token 消耗并让回答更有依据。
伯克利 AI 研究团队发布综述,分析并行推理领域进展,重点讨论自适应并行推理——让推理模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调。文章指出,顺序推理随探索量线性扩展,会遭遇上下文退化(context-rot)并导致延迟随推理长度成比例增长,复杂任务常需用户等待数十分钟甚至数小时。