跳到正文
10月5日周一
  1. GitHub Blog · AI & ML62

    GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准

    GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,研究预览版已上线网站。基准包含来自 187 个开源仓库、19 种语言的 219 个 pull request,其语言和仓库规模分布对齐 GitHub 上 103.9M 个真实 pull request,并采用多来源 golden set 与统一评分标准。

    推荐理由:GitHub 公开了代码审查基准的构建方法与评测口径,读者可据此理解 AI 代码审查能力如何被量化比较。

10月4日周日
  1. Hugging Face Blog72

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态评测 AI 智能体

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再依据终端后端状态和副作用而非生成的语句来评分,覆盖 507 个有状态业务流程、每个任务重复 20 次。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非工具调用判断成败,并给出 20 次重复的一致性数据。

10月1日周四
9月24日周四
  1. Microsoft Research60

    微软研究院:将物理 AI 推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院对移动操作机器人工作负载做了首次系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU,可提升任务成功率、支持更大模型并延长续航。

    推荐理由:微软研究院系统测量了机器人端侧推理的性能与续航代价,并给出可复用的卸载工具链,适合关注具身智能系统架构的读者。

9月21日周一
8月21日周五
  1. Microsoft Research41

    微软 Skala 1.1 发布:训练数据增至 2.5 倍,并集成进 CP2K 等主流 DFT 软件

    微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时微软推出持续追踪各版本计算性能的 living benchmark。