跳到正文
今天10月7日周三4 条
  1. Microsoft Research20

    Microsoft 研究员 Jennifer Neville:AI 评测如何暴露模型的“意外失败”

    Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统突破传统 benchmark 的性能边界,以及模型在超出常规测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。

10月6日周二
10月3日周六
  1. OpenAI News60

    OpenAI 发布 GPT-6 家族模型使用指南

    OpenAI 发布 GPT-6 家族模型指南,面向初创公司讲解如何选择 GPT-6 模型、调节推理强度、改进提示词与技能、协调工具,并为生产环境准备工作流。

    推荐理由:OpenAI 官方给出 GPT-6 家族的选型与调优路径,适合正在把模型接入生产工作流的团队参考。

10月2日周五
  1. NVIDIA Blog80

    NVIDIA GPU 如何加速 OpenAI GPT-6 Astra Ultrafast

    GPT-6 Astra Ultrafast 已在 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户中开放,运行在 NVIDIA Blackwell GPU 上,token 生成速度最高比 Astra Standard 模式快 8 倍。

    推荐理由:原文给出 Astra Ultrafast 相对标准模式的加速倍数与开放入口,读者可据此判断它对编码智能体循环的实际影响。

10月1日周四
  1. Google DeepMind87

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者,起价为每百万输入 token 2 美元、每百万输出 token 10 美元,缓存输入 token 按输入价的 95% 折扣计费。

    推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准成绩和分阶段开放路径,可据此判断前沿模型的能力边界与安全取舍。

9月16日周三
8月17日周一
  1. Import AI32

    Import AI 469:DiG-bench 评测科学 AI、RSI 模拟器与扎克伯格的技术悲观主义

    DiG-bench(Discovery in Games)发布,包含 70 款隐藏规则的手工游戏,用于测试 AI 通过探索自主发现环境规则的能力,目前仅公开 21 款。Opus 5 与 Fable 5 搭配 Claude Code 表现最佳,仅在 Tier 7 取得 0.2 成功率,而人类可达 100%。Inherent 同期发布 Faraday,用小型开源模型监督前沿模型以提升科研表现。

7月29日周三
7月26日周日
  1. Berkeley AI Research32

    ABBEL:通过信念状态监督让 LLM 高效完成长程交互

    伯克利 AI 研究提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,用类似自编码器的重建评分作为奖励。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将上下文摘要模型与全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值 token 用量也低于全上下文方案。

5月8日周五
  1. Berkeley AI Research34

    自适应并行推理:高效推理扩展的下一个范式

    自适应并行推理让模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调它们。现有并行推理方法多由外部固定并行结构,如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS,以及 ParaThinker、GroupThink、Hogwild! Inference 等新变体,但都未让模型学会这种自适应行为。

4月20日周一
  1. Berkeley AI Research38

    GRASP:面向世界模型的梯度规划方法,让长时程规划更稳健

    伯克利 AI 研究团队提出 GRASP,一种面向学习动力学(世界模型)的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度。该方法针对长时程规划中优化病态、非贪心结构导致的局部极小值和高维隐空间失效模式等问题,使基于梯度的规划更稳健。

3月13日周五