研究者将 LeCun 的 JEPA 扩展为跨物理与生物的世界模型 JEPA-Anything
PhAI Labs 联合斯坦福、牛津、普林斯顿的研究者提出 JEPA-Anything,把 JEPA 的预测状态拆成四个正交因子、各由独立预测模块处理,再重组为完整世界状态,从而用同一套架构覆盖物理、机器人、天气、单细胞和临床等七个领域。
PhAI Labs 联合斯坦福、牛津、普林斯顿的研究者提出 JEPA-Anything,把 JEPA 的预测状态拆成四个正交因子、各由独立预测模块处理,再重组为完整世界状态,从而用同一套架构覆盖物理、机器人、天气、单细胞和临床等七个领域。
Google Earth AI 的 Population Dynamics Foundation Model(PDFM)被验证可作为即插即用的位置嵌入向量,无需任务特定微调即可增强现有流行病学模型。
MIT Technology Review 对 300 名数据与 AI 高管的调研显示,企业平均仅约 34% 的智能体 AI 项目能进入生产环境,遗留数据系统、安全隐私顾虑以及知识与上下文缺失是主要失败点。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功经验,自动生成并验证新的可执行训练任务,并随模型进步动态调整课程。该流程在 EnterpriseOps Gym 数据集上进行了演示,生成的任务需满足可行性、真实性与难度三项要求,验证器则需保证一致性、可靠性与完整性。
微软研究院实习生开发了一套端到端机器学习系统,可提前 30-60 分钟为美国本土 66,935 座变电站生成空间天气风险预测。
Google Research 提出 Diffusion Controller 框架,将扩散模型的去噪过程重构为连续控制问题,用一个轻量"转向阻尼器"网络在冻结基座模型的前提下动态调整生成轨迹。在 Stable Diffusion v1.4 上,其完全解锁版本对基线模型取得 90% 胜率,轻量插件网络在人类偏好匹配上超过行业标准,并支持对闭源黑盒模型进行控制。
微软研究院在 Nature 发表逆向合成模型 RetroChimera,它结合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc,用学习式集成排序整合两者预测。
Google Research 发布 MilleMiglia,一个用 C++ 编写的实例生成器,可为中段(middle-mile)物流配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 公开。
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现单次非自回归的查询扇出,无需推理时的 CoT 思考 token。
METR 研究显示 AI 对科学的加速并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域 arXiv 投稿量在部分方向不到 12 个月翻倍,而 AI 研究自身的算法进展尚无可测量加速。多校团队提出 SPADE,用 LLM 交替生成可执行训练环境与求解,在 Qwen3-30B-A3B 上游戏环境套件平均分达 58.3,较基线提升 8.1。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时微软推出持续追踪各版本计算性能的 living benchmark。
DiG-bench(Discovery in Games)发布,包含 70 款隐藏规则的手工游戏,用于测试 AI 通过探索自主发现环境规则的能力,目前仅公开 21 款。Opus 5 与 Fable 5 搭配 Claude Code 表现最佳,仅在 Tier 7 取得 0.2 成功率,而人类可达 100%。Inherent 同期发布 Faraday,用小型开源模型监督前沿模型以提升科研表现。
伯克利 AI 研究提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,用类似自编码器的重建评分作为奖励。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将上下文摘要模型与全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值 token 用量也低于全上下文方案。
自适应并行推理让模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调它们。现有并行推理方法多由外部固定并行结构,如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS,以及 ParaThinker、GroupThink、Hogwild! Inference 等新变体,但都未让模型学会这种自适应行为。
伯克利 AI 研究团队提出 GRASP,一种面向学习动力学(世界模型)的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度。该方法针对长时程规划中优化病态、非贪心结构导致的局部极小值和高维隐空间失效模式等问题,使基于梯度的规划更稳健。
伯克利 AI Research 提出基于互信息的成像系统评估与优化框架,仅用带噪测量和噪声模型即可量化系统的信息含量,在彩色摄影、射电天文、无透镜成像和显微成像四个领域验证其能预测解码器性能。该方法优化出的设计可媲美端到端 SOTA 方法,同时占用更少内存和算力,且无需任务专用解码器设计。