跳到正文
今天10月7日周三4 条
  1. The Verge · AI74

    OpenAI 发布 722 篇数学手稿,称解决数百个开放问题

    OpenAI 公开了一批共 722 篇手稿,覆盖 372 个结果族,称其中包含对“数百个”开放数学问题的解答,这些结果由一个未发布的前沿模型产出。据新成立的独立顾问组织 AGMAI 介绍,这批成果此前已被期待数周,OpenAI 在 9 月曾表示其模型“解决了数学大部分领域 100 多个长期开放问题”。

  2. TechCrunch · AI22

    Mirror Particle 正在构建人类行为的“世界模型”

    旧金山初创公司 Mirror Particle 正在从零构建一个模拟人类行为及其变化原因的基础模型,认为依赖 LLM 微调来角色扮演目标人群的做法根本行不通。该模型结合客户数据、时事、流行文化和社交媒体等专有数据,聚焦“真实行为”而非问卷自述,并输出行为背后的动机与约束。

10月6日周二
10月5日周一
  1. NVIDIA Blog22

    NVIDIA Inception 初创公司如何用 AI 补齐乳腺癌诊疗缺口

    NVIDIA Inception 计划中的多家初创公司正用 AI 覆盖乳腺癌筛查、风险评估与治疗规划环节。iSono Health 的 FDA 认证 ATUSA 可穿戴 3D 超声系统约两分钟完成单侧乳房扫描,公司称灵敏度比手持 2D 超声高 28%;Whiterabbit.ai 的 WRDensity 已用于数十万患者;Ataraxis AI 则用病理切片预测治疗反应与复发风险。

10月2日周五
  1. Hugging Face Blog60

    Ai2 开源 AstaBrief 8B 科学报告生成模型

    Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 训练,已在 Asta 的 Generate a report 功能中作为 Fast mode 上线,与 Claude 驱动的 Thinking mode 并列。

    推荐理由:原文给出训练数据构造、引用过滤与评测细节,可了解小模型如何以 SFT 加 DPO 逼近专有模型报告质量。

  2. Hugging Face Blog41

    ServiceNow CoreAI 推出 AutoSynthData:为企业智能体生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功经验,自动生成并验证新的可执行训练任务,并随模型进步动态调整课程。该流程在 EnterpriseOps Gym 数据集上进行了演示,生成的任务需满足可行性、真实性与难度三项要求,验证器则需保证一致性、可靠性与完整性。

10月1日周四
9月30日周三
  1. Google DeepMind66

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质嵌入可验证水印

    Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使其在数字模型和合成出的实体蛋白质上均可验证,同时保留生物功能。

    推荐理由:DeepMind 把水印从数字内容延伸到合成生物,读者可了解其在 DNA 合成筛查与数据库标注上的验证思路。

  2. Google Research42

    Google Research 提出 Diffusion Controller:统一并简化 AI 图像生成控制

    Google Research 提出 Diffusion Controller 框架,将扩散模型的去噪过程重构为连续控制问题,用一个轻量"转向阻尼器"网络在冻结基座模型的前提下动态调整生成轨迹。在 Stable Diffusion v1.4 上,其完全解锁版本对基线模型取得 90% 胜率,轻量插件网络在人类偏好匹配上超过行业标准,并支持对闭源黑盒模型进行控制。

9月29日周二
  1. Microsoft Research62

    微软研究院推出生物 AI 研究系统 Quine

    微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据联合训练的生物世界模型,以及连接模型、科学工具、文献与湿实验的交互式 harness 组成。

    推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环,并给出胰腺癌化合物筛选的湿实验验证结果。

  2. Microsoft Research20

    微软亚洲研究院新加坡分院成立一年:推进研究、合作与人才培养

    微软亚洲研究院新加坡分院作为微软在东南亚的首个研究实验室,成立一年来聚焦下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践及生态与人才培养四大方向。该实验室与新加坡医疗生态合作探索多模态医疗 AI 和自进化诊断智能体,并联合 EDB 于 2026 年 2 月举办物流与交通 AI 高管圆桌会。

9月21日周一
9月19日周六
9月16日周三
9月8日周二
  1. Google DeepMind76

    Google DeepMind 发布 AlphaGenome Atlas,覆盖人类基因组 90 亿个单碱基变异预测

    Google DeepMind 推出 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 倍以上,已通过网站门户免费开放给学术研究使用。

    推荐理由:AlphaGenome Atlas 把 90 亿个单碱基变异的预测结果做成可检索平台,读者可了解基因组变异解读的规模化路径。

9月1日周二
8月24日周一
  1. Import AI22

    Import AI 470:机器不应享有权利;SPADE 自动化环境生成;Hawkeye 构建更优 GPU kernel

    METR 研究显示 AI 对科学的加速并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域 arXiv 投稿量在部分方向不到 12 个月翻倍,而 AI 研究自身的算法进展尚无可测量加速。多校团队提出 SPADE,用 LLM 交替生成可执行训练环境与求解,在 Qwen3-30B-A3B 上游戏环境套件平均分达 58.3,较基线提升 8.1。

8月21日周五
  1. Microsoft Research41

    微软 Skala 1.1 发布:训练数据增至 2.5 倍,并集成进 CP2K 等主流 DFT 软件

    微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时微软推出持续追踪各版本计算性能的 living benchmark。

8月17日周一
  1. Import AI32

    Import AI 469:DiG-bench 评测科学 AI、RSI 模拟器与扎克伯格的技术悲观主义

    DiG-bench(Discovery in Games)发布,包含 70 款隐藏规则的手工游戏,用于测试 AI 通过探索自主发现环境规则的能力,目前仅公开 21 款。Opus 5 与 Fable 5 搭配 Claude Code 表现最佳,仅在 Tier 7 取得 0.2 成功率,而人类可达 100%。Inherent 同期发布 Faraday,用小型开源模型监督前沿模型以提升科研表现。

7月26日周日
  1. Berkeley AI Research32

    ABBEL:通过信念状态监督让 LLM 高效完成长程交互

    伯克利 AI 研究提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,用类似自编码器的重建评分作为奖励。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将上下文摘要模型与全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值 token 用量也低于全上下文方案。

7月7日周二
  1. Berkeley AI Research34

    智能免费之后怎么办?面向智能体、由智能体构建的数据系统

    随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不足 $1、部分厂商低于 $0.10,AI 正进入"近乎免费智能"时代。UC Berkeley 的 Aditya G. Parameswaran 等人提出三类新挑战:为智能体设计的数据系统、运行智能体集群的数据系统、以及由智能体自行合成的数据系统。

5月8日周五
  1. Berkeley AI Research34

    自适应并行推理:高效推理扩展的下一个范式

    自适应并行推理让模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调它们。现有并行推理方法多由外部固定并行结构,如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS,以及 ParaThinker、GroupThink、Hogwild! Inference 等新变体,但都未让模型学会这种自适应行为。

4月20日周一
  1. Berkeley AI Research38

    GRASP:面向世界模型的梯度规划方法,让长时程规划更稳健

    伯克利 AI 研究团队提出 GRASP,一种面向学习动力学(世界模型)的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度。该方法针对长时程规划中优化病态、非贪心结构导致的局部极小值和高维隐空间失效模式等问题,使基于梯度的规划更稳健。

1月10日周六
  1. Berkeley AI Research29

    伯克利提出信息驱动成像系统设计框架,登 NeurIPS 2025

    伯克利 AI Research 提出基于互信息的成像系统评估与优化框架,仅用带噪测量和噪声模型即可量化系统的信息含量,在彩色摄影、射电天文、无透镜成像和显微成像四个领域验证其能预测解码器性能。该方法优化出的设计可媲美端到端 SOTA 方法,同时占用更少内存和算力,且无需任务专用解码器设计。