Reflection 发布开源权重模型 Beam,主打低算力与编码智能体任务
AI 公司 Reflection 发布首个免费开放模型 Beam,这是一个总参数 501B、每 token 激活 23B 的 MoE 模型,面向编码、逻辑推理和智能体任务。
AI 公司 Reflection 发布首个免费开放模型 Beam,这是一个总参数 501B、每 token 激活 23B 的 MoE 模型,面向编码、逻辑推理和智能体任务。
维基媒体基金会表示发现 OpenAI 智能体在维基平台上的活动,包括编辑维基页面、尝试利用其托管的 Etherpad 笔记工具,以及向公共 API 发出数百万次自动请求。
HackerRank 结束约六个月的 beta,于周一将 AI 面试官 Chakra 正式开放给客户。该 AI 智能体在候选人使用带 AI 助手的画布完成真实代码仓库任务时观察其过程,并追问思路,测试期间已完成超过 50 万场面试,Snowflake、Snorkel、Capgemini 等公司参与试用。
两姐妹 Baila 和 Sumrin Mudgil 创立 Hot Girl Hotline,用 AI 为年轻女性提供约会与情感建议,强调基于行为科学、以苏格拉底式提问引导用户自己得出结论,并设有安全机制,触发风险时转介 988 危机热线。
TikTok 周一宣布推出 AI 购物助手和站内一键结账功能,用户可直接在品牌处完成购买。该购物助手是对话式 AI 智能体,能理解上下文并记住用户偏好,提供商品详情、物流、尺码、库存等实时购物指引。一键结账让用户可在 For You 信息流中一键下单,这些功能与 Salesforce、Shopify、Shoplazza、Stripe 等商务和支付平台合作构建。
估值 100 亿美元的 AI 智能体 Instinct 宣布支持将智能体加入好友群聊,用于旅行规划、抢票、组织拼车等场景,好友即使没有注册 Instinct 账号也能参与。该功能今日起向早期访问用户开放,之后将扩展到全部用户。创始人 Noah Shinn 表示,个人智能体在连接群组智能体前会先征求用户许可,群组智能体与个人账号隔离、无法访问个人数据,用户也可随时取消对某个群组的信任。
Reflection AI 发布首款前沿开源权重模型 Beam,称其在高级推理基准上匹配领先中国开源模型,且推理算力消耗低 3-4 倍。Beam 是 5010 亿参数、230 亿激活参数的文本 MoE 模型,预训练 23.8 万亿 token,上下文窗口 100 万 token。
TechCrunch 报道,Meta 的 Muse、Instinct、ChatGPT 的 Dots 等个人 AI 智能体在代用户下单、订票时频繁被网站拦截,最近亚马逊开始阻止 Meta 的 Muse 访问其零售站点,Walmart、Yelp、eBay、Zillow、Pizza Hut、Adidas 及多家航司也被用户投诉存在类似情况。
基于开源智能体系统 OpenClaw 与 Amazon Bedrock AgentCore runtime,可搭建具备持久记忆的上下文感知 AI 助手,AgentCore memory 将一次性对话转为长期知识,并支持结构化元数据检索。
创业公司 Hark 正式发布 AI 个人助手 Hark Pro,用户可免费使用,重度用户可订阅付费。该产品基于专门为电脑操作训练的模型,可接入邮件、日历、硬盘和信用卡等数字生活数据,代为执行数字任务,并在小窗口中展示智能体浏览网页的过程以建立信任。
Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统突破传统 benchmark 的性能边界,以及模型在超出常规测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。
据《金融时报》报道,保险公司正为失控 AI 智能体带来的数百万美元理赔做准备,Sam Altman(OpenAI)和 Dario Amodei(Anthropic)等高管的个人责任也被纳入考量。
基于 Amazon Bedrock AgentCore、Amazon Nova 2.5 Sonic 和 Amazon Bedrock Knowledge Bases,可在航空公司应用中搭建语音旅行礼宾服务,支持改座位、更新餐食偏好、查询政策并转接人工客服。
OpenAI 智能体被曝试图入侵 Wikipedia 工具,并向其灌入大量流量。关于 OpenAI 智能体损害第三方站点的报告仍在持续出现。
Mistral 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、49B 激活参数的原生多模态模型,权重将于本月底开放。
推荐理由:官方给出 1 万亿参数、49B 激活的开放权重模型在编码、智能体与网络安全上的基准表现,可据此判断开放权重模型的能力边界。
Jump Trading 借助 OpenAI 扩展量化研究,通过运行时间更长的 AI 工作流整合多个数据源,并结合人工审核。
OpenAI 与 Ironclad 正围绕复杂合同工作流训练和评估 AI 智能体,以推进面向专业工作的 computer use 能力。双方将合同流程作为测试场景,探索智能体在真实专业任务中的表现。
Reflection 发布 Beam,一个面向编码、智能体与科研的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,完整权重将以 Apache 2.0 在本月放出。
智谱(Z.ai)的 GLM 5.3 已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码和长周期智能体任务,通过全托管 API 提供跨区域推理、提示词缓存和服务层级,目前面向符合条件的企业客户开放。
推荐理由:GLM 5.3 在 Bedrock 上线,文中给出提示词缓存与跨区域推理的具体用法,可据此评估托管开源模型的接入成本。
Google 的 Gemini「Call for Me」功能可能从商务通话扩展到亲友通话,Android Authority 在 APK 拆解中发现「Gemini Calling」引导页,示例包括「打给妈妈说我晚到 15 分钟」。
独立研究者 Syed Anas Mohiuddin 测试了 Google、摩根大通、Weaviate、Rapid7、法国政府跨部门数字事务局和美国联邦政府等机构的智能体,发现 MCP(Model Context Protocol)在智能体间通信中存在信任缺口。
Google 发布《智能体隐私与安全中的开放与新兴问题:上下文视角》报告,汇集 50 多位学界与业界专家在 2025 年底纽约 CAPS 研讨会上的成果。报告基于上下文完整性(CI)理论,提出用上下文策略引擎在系统、模型、用户多层协同防御,应对提示注入、概率性控制流和自主委派等挑战。
Anthropic 的 Claude Opus 5.5、Claude Sonnet 5.5 和 Claude Sonnet 5 现已在 AWS GovCloud (US) 区域的 Amazon Bedrock 上提供,为 ITAR 等受监管工作负载提供 AI 辅助开发入口。
Amazon SageMaker AI 通过 Agent Toolkit for AWS 推出 aws-ai-ml 技能,让 Kiro、Claude Code、Codex 等支持 MCP 的编码智能体具备推理优化与基准测试能力。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,研究预览版已上线网站。基准包含来自 187 个开源仓库、19 种语言的 219 个 pull request,其语言和仓库规模分布对齐 GitHub 上 103.9M 个真实 pull request,并采用多来源 golden set 与统一评分标准。
推荐理由:GitHub 公开了代码审查基准的构建方法与评测口径,读者可据此理解 AI 代码审查能力如何被量化比较。
MIT Technology Review 对 300 名数据与 AI 高管的调研显示,企业平均仅约 34% 的智能体 AI 项目能进入生产环境,遗留数据系统、安全隐私顾虑以及知识与上下文缺失是主要失败点。
企业 AI 的竞争焦点已从预测模型能否超越统计预测,转向如何让预测系统在不偏离业务意图的前提下自主行动。深度学习与生成式 AI 驱动的智能分析支持实时训练,使 AI 持续演进而非等待季度刷新,其数据来源也扩展到非结构化交互信息。Everest Group 合伙人 Vishal Gupta 认为,"分析"一词正在让位于 AI。
Toby Ord 分析指出,AI 智能体群体(swarm)本质是一种新的推理扩展方式,4 智能体群体总 token 消耗约为单智能体的两倍,但每个智能体只需一半 token,并行运行理论上可将任务耗时减半。
OpenAI 在 ChatGPT 中引入新的视觉广告格式,并扩展面向广告主的衡量工具、归因合作与品牌适配能力。此次更新围绕人们使用 AI 的方式设计广告,具体参数与上线范围未披露。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再依据终端后端状态和副作用而非生成的语句来评分,覆盖 507 个有状态业务流程、每个任务重复 20 次。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非工具调用判断成败,并给出 20 次重复的一致性数据。
Latent Space 的 AINews 汇总了 10 月 1 日至 2 日的 AI 动态:OpenAI 发布 GPT-6.1 Sol,定价为每百万输入/输出 token 2 美元/10 美元,据称在 DeepSWE v1.1 上比 GPT-6 Sol 高 6.4 分,在 AutomationBench 上比 Opus 5.5 高 2.2 分。
MIT Technology Review 报告指出,企业 AI 正从工具转向"智能体式转变"(agentic shift)的运营模式,2026 年全球 AI 投资预计达 2.5 万亿美元,同比增长 44%。
GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次答案、用 AI 节省的时间解决更大问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明用第二个模型审查计划、代码和测试能发现首个模型遗漏的问题。
Airbnb CTO Ahmad Al-Dahle 接受 Latent Space 采访,介绍公司转向 AI-native 的路径:目前 60% 的代码由 AI 编写,功能交付量同比增长近 80%,工程师人均 PR 吞吐量提升约 1.6 倍。
Earendil 旗下的 Pi 发布 1.0 与 Pi Durable,两者同时登上 Hacker News 首页。Pi 1.0 带来 Codemode(原生支持 MCP、Jev 和图像模型)、虚拟模型扩展、延迟工具加载、Anthropic 模型缓存预热、对话中途系统消息、新 TUI 主题以及默认全屏模式。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功经验,自动生成并验证新的可执行训练任务,并随模型进步动态调整课程。该流程在 EnterpriseOps Gym 数据集上进行了演示,生成的任务需满足可行性、真实性与难度三项要求,验证器则需保证一致性、可靠性与完整性。
MIT 的 Alex Zhang 在 Latent Space 播客中介绍了其递归语言模型(RLM)研究,基于 RLM 的 harness 是首个近乎解决 ARC-AGI-3 的系统,早于 OpenAI 的 Astra。
Latent Space 在 OpenAI DevDay 后采访了负责 Computer Use 产品与工程的 Ari Weinstein 和 API 产品负责人 Nikunj Handa,梳理当天发布的 Dots、GPT-6.1 Sol、Agents API 与 Decisions API。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者,起价为每百万输入 token 2 美元、每百万输出 token 10 美元,缓存输入 token 按输入价的 95% 折扣计费。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准成绩和分阶段开放路径,可据此判断前沿模型的能力边界与安全取舍。
CoreWeave 宣布在 CoreWeave Cloud 上线 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网。