跳到正文
今天10月7日周三1 条
  1. Microsoft Research20

    Microsoft 研究员 Jennifer Neville:AI 评测如何暴露模型的“意外失败”

    Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统突破传统 benchmark 的性能边界,以及模型在超出常规测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。

10月1日周四
9月18日周五
  1. GitHub Blog · AI & ML22

    GitHub Podcast 拆解五大 AI 热梗:该不该读 AI 代码、RAG 是否已死、Skills 是否取代 MCP

    GitHub Podcast 最新一期拆解了五个 AI 开发热梗:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是连接工具与数据的标准接口,二者可组合使用。RAG 并未消亡,它为模型提供训练数据之外的信息,减少 token 浪费并让回答更有依据;微调模型也不必然说明代码库糟糕,AI 反而成为代码可维护性的又一道压力测试。

7月7日周二
  1. Berkeley AI Research34

    智能免费之后怎么办?面向智能体、由智能体构建的数据系统

    随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不足 $1、部分厂商低于 $0.10,AI 正进入"近乎免费智能"时代。UC Berkeley 的 Aditya G. Parameswaran 等人提出三类新挑战:为智能体设计的数据系统、运行智能体集群的数据系统、以及由智能体自行合成的数据系统。