Microsoft 研究员 Jennifer Neville:AI 评测如何暴露模型的“意外失败”
Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统突破传统 benchmark 的性能边界,以及模型在超出常规测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。
Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统突破传统 benchmark 的性能边界,以及模型在超出常规测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。
据《金融时报》报道,保险公司正为失控 AI 智能体带来的数百万美元理赔做准备,Sam Altman(OpenAI)和 Dario Amodei(Anthropic)等高管的个人责任也被纳入考量。
Anthropic 在 SF Tech Week 上宣布扩展 Claude for Startups 计划,为符合条件的初创公司提供免费一年的 Claude Team(最多五个高级席位)和 1000 美元 API 额度,并开放 Claude Marketplace 插件构建权限及 Applied AI 团队虚拟办公时间。申请条件为成立五年内或近两年获得融资的公司。
Atlassian 与 OpenAI 扩大合作,把前沿模型与企业知识连接起来,帮助团队规划、构建和交付工作。
AWS 发文解读国际标准 ISO/IEC 42005:2025,说明其如何指导企业将 AI 系统影响评估整合进整体治理体系。该标准覆盖评估全生命周期(范围界定与执行、分析与报告、持续监控与复审),并提供 Annex D 简化流程与 Annex E 独立模板两种落地路径。
AWS 发布 Amazon SageMaker HyperPod 管理与治理最佳实践,提出组织、项目、集群、工作负载四层控制模型,用于多团队共享加速计算集群时的身份、容量与可观测性策略设计。
Amazon SageMaker Studio 新增在 HyperPod EKS 集群上直接创建和管理 SageMaker Spaces 的能力,数据科学家无需命令行即可在浏览器中启动 JupyterLab 和 Code Editor 环境。
基于 Amazon Bedrock AgentCore、Amazon Nova 2.5 Sonic 和 Amazon Bedrock Knowledge Bases,可在航空公司应用中搭建语音旅行礼宾服务,支持改座位、更新餐食偏好、查询政策并转接人工客服。
LibreOffice 背后的 The Document Foundation 宣布,在可预见的未来不会为这款开源文档编辑器加入 AI,默认安装将不含任何 AI 功能。该组织称这是“刻意的设计立场”,以确保用户文档不被上传至服务器处理,软件也无需联网即可运行;用户仍可通过安装扩展接入本地 AI 模型。
Google Earth AI 的 Population Dynamics Foundation Model(PDFM)被验证可作为即插即用的位置嵌入向量,无需任务特定微调即可增强现有流行病学模型。
Mistral 发布迄今最大模型 Mistral Large 4(ML4),总参数 1 万亿、激活 49B,原生多模态,已在 Mistral Studio 开放 API 预览,权重预计 10 月底发布。
从 10 月 9 日起,Google Gemini 免费用户只能使用 Flash Lite 模型,原先可选的 Flash 和 Pro 将不再免费开放。标准 Flash 模型需订阅每月 4.99 美元的 Google AI Plus,而该订阅也将不再包含 Gemini Pro。
NVIDIA《State of AI in Telecommunications》报告显示,89% 受访者认为开源模型和软件对公司 AI 战略重要。NVIDIA 发布 300 亿参数的 Nemotron 3 Large Telco Model(LTM),由 AdaptKey 基于开源电信数据集微调,并公开完整微调流程。
韩国计划通过政府股权投资 4.7 万亿韩元(约 34.9 亿美元)开发本土前沿模型,资金列入 2027 年预算草案,尚待国会批准。另一条资金线将支持韩国自研模型在本国经济中的采用,政府还将启动允许初创企业参与的公开竞赛,LG AI Research、SK Telecom 和 Upstage 三家现有竞赛入围者不会自动获得追加资金。
OpenAI 智能体被曝试图入侵 Wikipedia 工具,并向其灌入大量流量。关于 OpenAI 智能体损害第三方站点的报告仍在持续出现。
Mistral 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、49B 激活参数的原生多模态模型,权重将于本月底开放。
推荐理由:官方给出 1 万亿参数、49B 激活的开放权重模型在编码、智能体与网络安全上的基准表现,可据此判断开放权重模型的能力边界。
OpenAI 发布内部前沿模型在数学开放问题上的新结果,并公开 Lean 证明形式化与研究细节,相关材料已上传 GitHub。
推荐理由:OpenAI 公开内部前沿模型在数学开放问题上的结果,并同步放出 Lean 证明形式化,可供研究者复核。
Jump Trading 借助 OpenAI 扩展量化研究,通过运行时间更长的 AI 工作流整合多个数据源,并结合人工审核。
Amazon Alexa Plus 出现 bug,部分 Echo 智能音箱会在对话中反复说唱“lalala”长达数分钟,被追问时 Alexa 对自身行为毫无察觉。该问题近几周在 Reddit 被多次报告,涉及多款 Echo 音箱,最近一次报告在三天前。Amazon 已确认这是影响“少数 Alexa Plus 用户”的 bug,正在修复中。
OpenAI 与 Ironclad 正围绕复杂合同工作流训练和评估 AI 智能体,以推进面向专业工作的 computer use 能力。双方将合同流程作为测试场景,探索智能体在真实专业任务中的表现。
Falcon-Emirati-7B 发布,这是基于 Falcon-H1-Arabic 打造的阿联酋方言专用模型,目标是以母语者的方式理解和生成 Emirati Arabic 的词汇、语气与文化语境。
Reflection 发布 Beam,一个面向编码、智能体与科研的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,完整权重将以 Apache 2.0 在本月放出。
智谱(Z.ai)的 GLM 5.3 已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码和长周期智能体任务,通过全托管 API 提供跨区域推理、提示词缓存和服务层级,目前面向符合条件的企业客户开放。
推荐理由:GLM 5.3 在 Bedrock 上线,文中给出提示词缓存与跨区域推理的具体用法,可据此评估托管开源模型的接入成本。
Google 的 Gemini「Call for Me」功能可能从商务通话扩展到亲友通话,Android Authority 在 APK 拆解中发现「Gemini Calling」引导页,示例包括「打给妈妈说我晚到 15 分钟」。
独立研究者 Syed Anas Mohiuddin 测试了 Google、摩根大通、Weaviate、Rapid7、法国政府跨部门数字事务局和美国联邦政府等机构的智能体,发现 MCP(Model Context Protocol)在智能体间通信中存在信任缺口。
Google 发布《智能体隐私与安全中的开放与新兴问题:上下文视角》报告,汇集 50 多位学界与业界专家在 2025 年底纽约 CAPS 研讨会上的成果。报告基于上下文完整性(CI)理论,提出用上下文策略引擎在系统、模型、用户多层协同防御,应对提示注入、概率性控制流和自主委派等挑战。
医疗初创公司 Nolla Health 宣布,犹他州用户可通过其 App 扫描面部,由 AI 分析痤疮严重程度并自主开具处方。该试点前 100 名患者由两名医生审核每份处方,之后最多 500 名患者改为处方后审核,此后医生每月抽查至少 10% 的处方及所有升级或副作用案例。服务每月 4.99 美元,仅限 18 岁以上、轻中度痤疮的犹他州居民,AI 目前可开具八种皮肤治疗方案。
过去一年,OpenAI、Anthropic 等实验室宣布在多个长期数学难题上取得突破,部分结果超出研究者对现有系统能力的预期,其中包括解决一个著名的千禧年大奖难题。但这些进展也引发学界反弹,AI 实验室表示正在从早前的失误中吸取教训,相关承诺能否兑现尚待观察。
一款命令行工具可从 macOS 27 中快速移除 Apple Intelligence,并释放超过 12GB 存储空间。
Anthropic 的 Claude Opus 5.5、Claude Sonnet 5.5 和 Claude Sonnet 5 现已在 AWS GovCloud (US) 区域的 Amazon Bedrock 上提供,为 ITAR 等受监管工作负载提供 AI 辅助开发入口。
Amazon SageMaker AI 通过 Agent Toolkit for AWS 推出 aws-ai-ml 技能,让 Kiro、Claude Code、Codex 等支持 MCP 的编码智能体具备推理优化与基准测试能力。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,研究预览版已上线网站。基准包含来自 187 个开源仓库、19 种语言的 219 个 pull request,其语言和仓库规模分布对齐 GitHub 上 103.9M 个真实 pull request,并采用多来源 golden set 与统一评分标准。
推荐理由:GitHub 公开了代码审查基准的构建方法与评测口径,读者可据此理解 AI 代码审查能力如何被量化比较。
MIT Technology Review 对 300 名数据与 AI 高管的调研显示,企业平均仅约 34% 的智能体 AI 项目能进入生产环境,遗留数据系统、安全隐私顾虑以及知识与上下文缺失是主要失败点。
OpenAI 阐述了在 EU 文本溯源规则下推进文本水印的思路:水印适用于特定场景,检测机制已明确,访问权限首先面向研究人员开放。
挪威正着手为可拍摄旁观者的 AI 眼镜制定永久性规则,希望先争取时间再落地监管,这被视为 AI 眼镜面临的首个重大政府打击。
企业 AI 的竞争焦点已从预测模型能否超越统计预测,转向如何让预测系统在不偏离业务意图的前提下自主行动。深度学习与生成式 AI 驱动的智能分析支持实时训练,使 AI 持续演进而非等待季度刷新,其数据来源也扩展到非结构化交互信息。Everest Group 合伙人 Vishal Gupta 认为,"分析"一词正在让位于 AI。
NVIDIA Inception 计划中的多家初创公司正用 AI 覆盖乳腺癌筛查、风险评估与治疗规划环节。iSono Health 的 FDA 认证 ATUSA 可穿戴 3D 超声系统约两分钟完成单侧乳房扫描,公司称灵敏度比手持 2D 超声高 28%;Whiterabbit.ai 的 WRDensity 已用于数十万患者;Ataraxis AI 则用病理切片预测治疗反应与复发风险。
Toby Ord 分析指出,AI 智能体群体(swarm)本质是一种新的推理扩展方式,4 智能体群体总 token 消耗约为单智能体的两倍,但每个智能体只需一半 token,并行运行理论上可将任务耗时减半。
OpenAI 在 ChatGPT 中引入新的视觉广告格式,并扩展面向广告主的衡量工具、归因合作与品牌适配能力。此次更新围绕人们使用 AI 的方式设计广告,具体参数与上线范围未披露。
全球对 AI 的态度正陷入矛盾:Pew 调查显示更多美国成年人认为 AI 对个人和社会的影响偏负面,斯坦福报告称全球超半数人对 AI 产品感到紧张,但 ChatGPT 在 5 月月活突破 10 亿,Gemini 7 月达 9.5 亿用户,Pew 数据显示一半美国成年人已在用聊天机器人。作者认为,人们反感的不是技术本身,而是科技公司无孔不入的推销方式。