用 Amazon Bedrock AgentCore 评估多智能体系统的可解释性与有用性
Amazon Bedrock AgentCore Evaluations 支持内置与自定义评估器,用于在多智能体系统的开发和生产阶段衡量准确性、任务成功率与行为表现。
Amazon Bedrock AgentCore Evaluations 支持内置与自定义评估器,用于在多智能体系统的开发和生产阶段衡量准确性、任务成功率与行为表现。
Amazon Quick 控制台不支持将用户从 Admin 或 Author 直接降级为 Reader,update-user API 也会返回“You cannot downgrade a user role”错误。
Amazon Bedrock Managed Knowledge Base 上线智能体检索,通过 AgenticRetrieveStream API 将多部分问题拆成子查询、执行并判断证据是否充分,不足则再次检索,而 Retrieve API 只做单次混合搜索。
Amazon Quick 的跨账户资源迁移可通过部署在 Amazon Bedrock AgentCore 上的 MCP 服务器实现自动化,单次工具调用即可完成 agent、action connector、知识库、flow 和 space 的迁移。
基于开源智能体系统 OpenClaw 与 Amazon Bedrock AgentCore runtime,可搭建具备持久记忆的上下文感知 AI 助手,AgentCore memory 将一次性对话转为长期知识,并支持结构化元数据检索。
AWS 发文解读国际标准 ISO/IEC 42005:2025,说明其如何指导企业将 AI 系统影响评估整合进整体治理体系。该标准覆盖评估全生命周期(范围界定与执行、分析与报告、持续监控与复审),并提供 Annex D 简化流程与 Annex E 独立模板两种落地路径。
AWS 发布 Amazon SageMaker HyperPod 管理与治理最佳实践,提出组织、项目、集群、工作负载四层控制模型,用于多团队共享加速计算集群时的身份、容量与可观测性策略设计。
Amazon SageMaker Studio 新增在 HyperPod EKS 集群上直接创建和管理 SageMaker Spaces 的能力,数据科学家无需命令行即可在浏览器中启动 JupyterLab 和 Code Editor 环境。
Google Earth AI 的 Population Dynamics Foundation Model(PDFM)被验证可作为即插即用的位置嵌入向量,无需任务特定微调即可增强现有流行病学模型。
NVIDIA《State of AI in Telecommunications》报告显示,89% 受访者认为开源模型和软件对公司 AI 战略重要。NVIDIA 发布 300 亿参数的 Nemotron 3 Large Telco Model(LTM),由 AdaptKey 基于开源电信数据集微调,并公开完整微调流程。
智谱(Z.ai)的 GLM 5.3 已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码和长周期智能体任务,通过全托管 API 提供跨区域推理、提示词缓存和服务层级,目前面向符合条件的企业客户开放。
推荐理由:GLM 5.3 在 Bedrock 上线,文中给出提示词缓存与跨区域推理的具体用法,可据此评估托管开源模型的接入成本。
Anthropic 的 Claude Opus 5.5、Claude Sonnet 5.5 和 Claude Sonnet 5 现已在 AWS GovCloud (US) 区域的 Amazon Bedrock 上提供,为 ITAR 等受监管工作负载提供 AI 辅助开发入口。
Amazon SageMaker AI 通过 Agent Toolkit for AWS 推出 aws-ai-ml 技能,让 Kiro、Claude Code、Codex 等支持 MCP 的编码智能体具备推理优化与基准测试能力。
OpenAI 发布 GPT-6 家族模型指南,面向初创公司讲解如何选择 GPT-6 模型、调节推理强度、改进提示词与技能、协调工具,并为生产环境准备工作流。
推荐理由:OpenAI 官方给出 GPT-6 家族的选型与调优路径,适合正在把模型接入生产工作流的团队参考。
Google Research 发布新一代联邦学习系统,利用可信执行环境(TEE)为数据匿名化提供可验证、可审计的保证,并已由 Gboard 采用。该系统通过访问策略公开透明日志、KMS 密钥管理和 TEE 内 Python 训练程序执行,使加密训练数据只能在符合访问策略的 TEE 中解密处理。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的实际部署结果。
NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 64GB 统一内存版 DGX Spark,10 月 23 日开售,起售价 4,999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 与完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备本地运行。
推荐理由:原文给出 64GB 新配置的定价、上市时间与双机集群方式,读者可据此判断本地跑大模型的门槛。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功经验,自动生成并验证新的可执行训练任务,并随模型进步动态调整课程。该流程在 EnterpriseOps Gym 数据集上进行了演示,生成的任务需满足可行性、真实性与难度三项要求,验证器则需保证一致性、可靠性与完整性。
Chatham Financial 借助 OpenAI 的 Codex 和 GPT-5.6 构建技术并重构工作流,将交易验证时间从 30 分钟缩短至 4 分钟以内。该机构借此扩展其资本市场专业能力。
GPT-6 Astra Ultrafast 已在 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户中开放,运行在 NVIDIA Blackwell GPU 上,token 生成速度最高比 Astra Standard 模式快 8 倍。
推荐理由:原文给出 Astra Ultrafast 相对标准模式的加速倍数与开放入口,读者可据此判断它对编码智能体循环的实际影响。
NVIDIA 提出 AI 工厂投资回报由产出能力、使用寿命和需求三要素决定,其平台以高产出、长寿命、通用性同时优化三者。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐量超 GB300 NVL72 的 30 倍,在 DeepSeek V4 Pro 上每百万 token 成本最多低 45 倍。
微软研究院实习生开发了一套端到端机器学习系统,可提前 30-60 分钟为美国本土 66,935 座变电站生成空间天气风险预测。
CoreWeave 宣布在 CoreWeave Cloud 上线 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网。
Mistral 在慕尼黑开设德国中心,组建专注 Physics AI 与工业 AI 的研究团队,并计划到 2030 年建成 1 吉瓦欧洲算力。该中心将与 BMW 合作碰撞仿真与工程 AI、与 Siemens Energy 合作工业 AI 应用,并与慕尼黑工业大学(TUM)合作利用风洞设施开发汽车空气动力学数字孪生。Mistral 强调其开放权重架构让模型在客户自有基础设施上运行,数据不出组织。
H 公司发布 Holo4 系列智能体模型,包含 27B dense 与 35B-A3B MoE 两个版本,同时更新 Holotron 3 为 Holotron4 Nano。
推荐理由:Holo4 同时覆盖 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,可据此判断通用计算机智能体的成本与能力边界。
GitHub Copilot 应用推出 canvas 功能,一种运行在应用内、无浏览器外壳的全栈小应用,可与 Copilot 智能体双向通信,也能调用第三方 API 或在本地执行代码。
GitHub Copilot 应用重建了 pull request 视图,以应对超大 diff 与评论带来的渲染压力。团队用一个含 2,200 个文件、超 100 万行改动、400 多条行内评论的开源 pull request 做验证,将文档高度拆成确定性的代码几何与动态评论块两套几何,评论高度按需测量并锚定到文件、行和侧,避免滚动跳动。
微软研究院对移动操作机器人工作负载做了首次系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU,可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软研究院系统测量了机器人端侧推理的性能与续航代价,并给出可复用的卸载工具链,适合关注具身智能系统架构的读者。
Google Private AI Compute 团队公布为 Private AI Compute 平台引入私有服务端记忆的技术方案,让云端 AI 助手能在跨设备场景下持久保留上下文,同时维持端侧级别的隐私标准。
推荐理由:Google 给出私有 AI 计算新增持久化服务端记忆的架构细节,可据此理解云端助手如何在跨设备场景下保留上下文。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体写了大部分代码,分布在 128 个 PR 中增量合入 main,而非一次性切换。
推荐理由:作者以亲历者身份复盘用 AI 智能体把 80 万行运行时从 TypeScript 迁到 Rust 的完整工程方法,可迁移到大规模重构。
Mistral 与 Cloudera 宣布合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。企业还能在受控环境中用专有数据训练定制模型,数据与由此产生的智能均归企业所有。Cloudera 平台承载 30 exabytes 客户自管数据。
Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件也没有集中文档。团队先搭建数值对齐测试框架,用自定义解析器生成调用树并派出上百个智能体补文档,最终采用人工把关的 coder、tester、reviewer 智能体工作流逐模块迁移。
推荐理由:Mistral 公开了用智能体迁移 4 万行 Fortran 的完整工作流,其中先建数值对齐测试再迁移的做法可直接迁移到其他遗留系统改造。
Mistral 与 HUMAIN 宣布在 AI 基础设施、先进模型开发和 AI 解决方案部署上展开战略合作,初期聚焦网络安全与语音,并计划开发阿拉伯语表现强劲的前沿模型。合作规模达数亿欧元,Mistral 将探索使用 HUMAIN 的数据中心基础设施,双方还计划在沙特面向受监管行业制定联合市场策略。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时微软推出持续追踪各版本计算性能的 living benchmark。
Mistral 发布 Agentic Search,作为检索层让模型在多步循环中查找、打开、导航、阅读和校验复杂文档中的信息,通过 Mistral Search Toolkit 提供,并内置在 Studio 和 Vibe 的 Libraries 中。
推荐理由:原文给出多步检索循环在 FinanceBench 与 OfficeQA Pro 上的准确率、token 与延迟变化,可据此判断它与一次性 RAG 的差别。
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,并加入结构化 CUDA-to-MLX 翻译层,让已有 CUDA 内核作为知识库适配 Apple Silicon。
推荐理由:读者可看到 CUDA 内核经验如何被结构化迁移到 Apple Silicon,以及翻译层对性能差距的具体贡献。
随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不足 $1、部分厂商低于 $0.10,AI 正进入"近乎免费智能"时代。UC Berkeley 的 Aditya G. Parameswaran 等人提出三类新挑战:为智能体设计的数据系统、运行智能体集群的数据系统、以及由智能体自行合成的数据系统。
自适应并行推理让模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调它们。现有并行推理方法多由外部固定并行结构,如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS,以及 ParaThinker、GroupThink、Hogwild! Inference 等新变体,但都未让模型学会这种自适应行为。