研究者将 LeCun 的 JEPA 扩展为跨物理与生物的世界模型 JEPA-Anything
PhAI Labs 联合斯坦福、牛津、普林斯顿的研究者提出 JEPA-Anything,把 JEPA 的预测状态拆成四个正交因子、各由独立预测模块处理,再重组为完整世界状态,从而用同一套架构覆盖物理、机器人、天气、单细胞和临床等七个领域。
PhAI Labs 联合斯坦福、牛津、普林斯顿的研究者提出 JEPA-Anything,把 JEPA 的预测状态拆成四个正交因子、各由独立预测模块处理,再重组为完整世界状态,从而用同一套架构覆盖物理、机器人、天气、单细胞和临床等七个领域。
OpenAI 发布了一个内部前沿模型生成的 372 条数学结果,每条都声称解决或显著推进了一个未解问题,其中包含对重要计算机算法的改进以及与黎曼假设相关的进展。
同一新闻,精选展示《OpenAI 公开前沿模型在数学开放问题上的进展》
OpenAI 从内部前沿模型发布了一批数学成果,公开在 GitHub 仓库中,包含 722 篇论文、分为 372 个相关结果族,来自约 4000 个研究问题的评测,平均每个结果约用 3 小时 ChatGPT Pro 思考算力,模型本身尚未发布。
推荐理由:OpenAI 用内部模型批量产出数学结果,读者可据此了解其规模、算力成本与学界对验证的保留意见。
Google Earth AI 的 Population Dynamics Foundation Model(PDFM)被验证可作为即插即用的位置嵌入向量,无需任务特定微调即可增强现有流行病学模型。
OpenAI 发布内部前沿模型在数学开放问题上的新结果,并公开 Lean 证明形式化与研究细节,相关材料已上传 GitHub。
推荐理由:OpenAI 公开内部前沿模型在数学开放问题上的结果,并同步放出 Lean 证明形式化,可供研究者复核。
Google 发布《智能体隐私与安全中的开放与新兴问题:上下文视角》报告,汇集 50 多位学界与业界专家在 2025 年底纽约 CAPS 研讨会上的成果。报告基于上下文完整性(CI)理论,提出用上下文策略引擎在系统、模型、用户多层协同防御,应对提示注入、概率性控制流和自主委派等挑战。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,研究预览版已上线网站。基准包含来自 187 个开源仓库、19 种语言的 219 个 pull request,其语言和仓库规模分布对齐 GitHub 上 103.9M 个真实 pull request,并采用多来源 golden set 与统一评分标准。
推荐理由:GitHub 公开了代码审查基准的构建方法与评测口径,读者可据此理解 AI 代码审查能力如何被量化比较。
MIT Technology Review 对 300 名数据与 AI 高管的调研显示,企业平均仅约 34% 的智能体 AI 项目能进入生产环境,遗留数据系统、安全隐私顾虑以及知识与上下文缺失是主要失败点。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再依据终端后端状态和副作用而非生成的语句来评分,覆盖 507 个有状态业务流程、每个任务重复 20 次。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非工具调用判断成败,并给出 20 次重复的一致性数据。
Google Research 发布新一代联邦学习系统,利用可信执行环境(TEE)为数据匿名化提供可验证、可审计的保证,并已由 Gboard 采用。该系统通过访问策略公开透明日志、KMS 密钥管理和 TEE 内 Python 训练程序执行,使加密训练数据只能在符合访问策略的 TEE 中解密处理。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的实际部署结果。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功经验,自动生成并验证新的可执行训练任务,并随模型进步动态调整课程。该流程在 EnterpriseOps Gym 数据集上进行了演示,生成的任务需满足可行性、真实性与难度三项要求,验证器则需保证一致性、可靠性与完整性。
微软研究院实习生开发了一套端到端机器学习系统,可提前 30-60 分钟为美国本土 66,935 座变电站生成空间天气风险预测。
Hugging Face 发布 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,单模型评测耗时从数周投票缩短到数小时。
Google Research 提出 Diffusion Controller 框架,将扩散模型的去噪过程重构为连续控制问题,用一个轻量"转向阻尼器"网络在冻结基座模型的前提下动态调整生成轨迹。在 Stable Diffusion v1.4 上,其完全解锁版本对基线模型取得 90% 胜率,轻量插件网络在人类偏好匹配上超过行业标准,并支持对闭源黑盒模型进行控制。
Hugging Face 博客介绍论文 ProvenanceGuard,一个面向 MCP 智能体的生成后验证层,可在不重训智能体的前提下读取 MCP 调用轨迹,逐条核查答案中的声明是否由其所声称的来源支持,以识别"跨来源混淆"。
Google Research 发布 AI video co-director,一个构建在 Gemini 和 Veo 之上的多智能体编排框架,用于生成连贯的多镜头长视频,并原生继承 SynthID 水印等安全机制。
推荐理由:Google 把长视频生成拆成四个可组合框架,并给出多镜头一致性的评测基准与量化结果。
微软研究院对移动操作机器人工作负载做了首次系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU,可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软研究院系统测量了机器人端侧推理的性能与续航代价,并给出可复用的卸载工具链,适合关注具身智能系统架构的读者。
微软研究院在 Nature 发表逆向合成模型 RetroChimera,它结合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc,用学习式集成排序整合两者预测。
RAND 发布报告提出美国应以"自由行动"战略应对通往超级智能的不确定路径,核心是保留选项而非锁定单一方案,并列出共存、拒止、加速三类共七种原型策略及五项关键不确定性。研究人员还培育出脑内含有部分人脑组织的小鼠,用于研究人类脑组织。
Google Research 发布 MilleMiglia,一个用 C++ 编写的实例生成器,可为中段(middle-mile)物流配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 公开。
Google Research 发布研究实验,让教师借助生成式 UI(GenUI)按自身课程目标动态生成互动式学习模拟,并同步开放 30 多个面向初高中 STEM 的英文学习互动样例库。
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现单次非自回归的查询扇出,无需推理时的 CoT 思考 token。
Google DeepMind 推出 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 倍以上,已通过网站门户免费开放给学术研究使用。
推荐理由:AlphaGenome Atlas 把 90 亿个单碱基变异的预测结果做成可检索平台,读者可了解基因组变异解读的规模化路径。
Google DeepMind 发表论文,用 100 个运行 Gemini 3.1 Pro 的自主智能体求解 71 道数学题,其中一道来自 Formal Conjectures 数据集。
METR 研究显示 AI 对科学的加速并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域 arXiv 投稿量在部分方向不到 12 个月翻倍,而 AI 研究自身的算法进展尚无可测量加速。多校团队提出 SPADE,用 LLM 交替生成可执行训练环境与求解,在 Qwen3-30B-A3B 上游戏环境套件平均分达 58.3,较基线提升 8.1。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时微软推出持续追踪各版本计算性能的 living benchmark。
DiG-bench(Discovery in Games)发布,包含 70 款隐藏规则的手工游戏,用于测试 AI 通过探索自主发现环境规则的能力,目前仅公开 21 款。Opus 5 与 Fable 5 搭配 Claude Code 表现最佳,仅在 Tier 7 取得 0.2 成功率,而人类可达 100%。Inherent 同期发布 Faraday,用小型开源模型监督前沿模型以提升科研表现。
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,并加入结构化 CUDA-to-MLX 翻译层,让已有 CUDA 内核作为知识库适配 Apple Silicon。
推荐理由:读者可看到 CUDA 内核经验如何被结构化迁移到 Apple Silicon,以及翻译层对性能差距的具体贡献。
伯克利 AI 研究提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,用类似自编码器的重建评分作为奖励。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将上下文摘要模型与全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值 token 用量也低于全上下文方案。
自适应并行推理让模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调它们。现有并行推理方法多由外部固定并行结构,如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS,以及 ParaThinker、GroupThink、Hogwild! Inference 等新变体,但都未让模型学会这种自适应行为。
伯克利 AI 研究团队提出 GRASP,一种面向学习动力学(世界模型)的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度。该方法针对长时程规划中优化病态、非贪心结构导致的局部极小值和高维隐空间失效模式等问题,使基于梯度的规划更稳健。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,可在特征、数据与模型组件归因中大规模识别驱动 LLM 输出的关键交互。SPEX 利用稀疏性与低阶性把交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层级结构,以约少 10 倍的消融次数达到 SPEX 的性能。
伯克利 AI Research 提出基于互信息的成像系统评估与优化框架,仅用带噪测量和噪声模型即可量化系统的信息含量,在彩色摄影、射电天文、无透镜成像和显微成像四个领域验证其能预测解码器性能。该方法优化出的设计可媲美端到端 SOTA 方法,同时占用更少内存和算力,且无需任务专用解码器设计。