跳到正文
今天10月7日周三1 条
  1. Microsoft Research20

    Microsoft 研究员 Jennifer Neville:AI 评测如何暴露模型的“意外失败”

    Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统突破传统 benchmark 的性能边界,以及模型在超出常规测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。

10月5日周一
  1. MIT Technology Review · AI12

    从预测到自主决策:预测分析如何进入智能体 AI 时代

    企业 AI 的竞争焦点已从预测模型能否超越统计预测,转向如何让预测系统在不偏离业务意图的前提下自主行动。深度学习与生成式 AI 驱动的智能分析支持实时训练,使 AI 持续演进而非等待季度刷新,其数据来源也扩展到非结构化交互信息。Everest Group 合伙人 Vishal Gupta 认为,"分析"一词正在让位于 AI。

10月2日周五
9月28日周一
  1. Import AI26

    Import AI 474:柏拉图式心智空间、太空中的 TPU、智谱启动外层 RSI 循环

    智谱启动了一个"外层 RSI 循环",探索递归自我改进的新路径。Michael Levin 提出"心智即柏拉图空间中的模式",认为身体与机器只是这些模式进入物理世界的接口,xenobots 和 anthrobots 等实验被视为佐证。本期还讨论了太空中的 TPU 部署与机器人领域正等待自己的"LLM 时刻"。

9月18日周五
  1. GitHub Blog · AI & ML22

    GitHub Podcast 拆解五大 AI 热梗:该不该读 AI 代码、RAG 是否已死、Skills 是否取代 MCP

    GitHub Podcast 最新一期拆解了五个 AI 开发热梗:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是连接工具与数据的标准接口,二者可组合使用。RAG 并未消亡,它为模型提供训练数据之外的信息,减少 token 浪费并让回答更有依据;微调模型也不必然说明代码库糟糕,AI 反而成为代码可维护性的又一道压力测试。

8月31日周一
7月7日周二
  1. Berkeley AI Research34

    智能免费之后怎么办?面向智能体、由智能体构建的数据系统

    随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不足 $1、部分厂商低于 $0.10,AI 正进入"近乎免费智能"时代。UC Berkeley 的 Aditya G. Parameswaran 等人提出三类新挑战:为智能体设计的数据系统、运行智能体集群的数据系统、以及由智能体自行合成的数据系统。