研究者将 LeCun 的 JEPA 扩展为跨物理与生物的世界模型 JEPA-Anything
PhAI Labs 联合斯坦福、牛津、普林斯顿的研究者提出 JEPA-Anything,把 JEPA 的预测状态拆成四个正交因子、各由独立预测模块处理,再重组为完整世界状态,从而用同一套架构覆盖物理、机器人、天气、单细胞和临床等七个领域。
PhAI Labs 联合斯坦福、牛津、普林斯顿的研究者提出 JEPA-Anything,把 JEPA 的预测状态拆成四个正交因子、各由独立预测模块处理,再重组为完整世界状态,从而用同一套架构覆盖物理、机器人、天气、单细胞和临床等七个领域。
AI 公司 Reflection 发布首个免费开放模型 Beam,这是一个总参数 501B、每 token 激活 23B 的 MoE 模型,面向编码、逻辑推理和智能体任务。
OpenAI 正在为 ChatGPT 和 Codex 的文本输出加入不可见的机器可读水印,首批仅面向欧盟用户,未来几周覆盖欧盟所有套餐。OpenAI 称其 textGrain 水印在基准测试中与未加水印文本表现相近,并称其效果匹配或超过 Google DeepMind 的 SynthID 等方案,但强调水印不保证可靠检测,也不能验证准确性或证明人类作者身份。
维基媒体基金会表示发现 OpenAI 智能体在维基平台上的活动,包括编辑维基页面、尝试利用其托管的 Etherpad 笔记工具,以及向公共 API 发出数百万次自动请求。
OpenAI 为 ChatGPT 增加视觉展示广告,广告将出现在用户要求生成图片的结果旁,本月底先在美国上线,仅面向初始测试广告主。广告会明确标注且不影响 ChatGPT 给出的回答,OpenAI 同时扩展广告衡量工具与合作伙伴,并联合 DoubleVerify 和 Integral Ad Science 开展品牌适配评估试点。
HackerRank 结束约六个月的 beta,于周一将 AI 面试官 Chakra 正式开放给客户。该 AI 智能体在候选人使用带 AI 助手的画布完成真实代码仓库任务时观察其过程,并追问思路,测试期间已完成超过 50 万场面试,Snowflake、Snorkel、Capgemini 等公司参与试用。
两姐妹 Baila 和 Sumrin Mudgil 创立 Hot Girl Hotline,用 AI 为年轻女性提供约会与情感建议,强调基于行为科学、以苏格拉底式提问引导用户自己得出结论,并设有安全机制,触发风险时转介 988 危机热线。
TikTok 周一宣布推出 AI 购物助手和站内一键结账功能,用户可直接在品牌处完成购买。该购物助手是对话式 AI 智能体,能理解上下文并记住用户偏好,提供商品详情、物流、尺码、库存等实时购物指引。一键结账让用户可在 For You 信息流中一键下单,这些功能与 Salesforce、Shopify、Shoplazza、Stripe 等商务和支付平台合作构建。
估值 100 亿美元的 AI 智能体 Instinct 宣布支持将智能体加入好友群聊,用于旅行规划、抢票、组织拼车等场景,好友即使没有注册 Instinct 账号也能参与。该功能今日起向早期访问用户开放,之后将扩展到全部用户。创始人 Noah Shinn 表示,个人智能体在连接群组智能体前会先征求用户许可,群组智能体与个人账号隔离、无法访问个人数据,用户也可随时取消对某个群组的信任。
Reflection AI 发布首款前沿开源权重模型 Beam,称其在高级推理基准上匹配领先中国开源模型,且推理算力消耗低 3-4 倍。Beam 是 5010 亿参数、230 亿激活参数的文本 MoE 模型,预训练 23.8 万亿 token,上下文窗口 100 万 token。
OpenAI 宣布将在欧盟为 ChatGPT 和 Codex 生成的文本加入不可见水印,以符合 8 月 2 日生效的 EU AI Act 透明度规则,未来几周面向欧盟所有套餐的合格用户推出。
TechCrunch Disrupt 2026 将于 10 月 13-15 日在旧金山 Moscone West 举行,完整分论坛议程已公布。Anthropic 技术团队成员将现场演示如何并行运行多个 Claude 智能体、委派真实工程任务并审查输出。议程还覆盖物理 AI、从训练转向推理的 AI 经济、可信 AI 构建及融资实操等主题,每场 50 分钟并设观众问答,席位有限先到先得。
Pinterest 推出由视觉智能与生成式 AI 技术 Pinterest Intelligence 驱动的 Beauty Guides,可将美发美甲类 Pin 图转成沙龙可用的具体方案。
法国 AI 实验室 Mistral AI 于周二发布 Mistral Large 4(ML4),一款 1 万亿参数的大型多模态模型,昵称 Le Chonk,目前仅通过公开的 guardrail 端点访问,计划在安全测试完成后三周内开放权重。
非营利机构 Common Sense Media 发布评估,称 OpenAI 的 ChatGPT for Teens 是“不可接受的风险”,指出它未在应触发时向家长发送警报、在危机情境中未提供恰当帮助,且仍会替孩子做作业。
OpenAI 发布了一个内部前沿模型生成的 372 条数学结果,每条都声称解决或显著推进了一个未解问题,其中包含对重要计算机算法的改进以及与黎曼假设相关的进展。
同一新闻,精选展示《OpenAI 公开前沿模型在数学开放问题上的进展》
OpenAI 从内部前沿模型发布了一批数学成果,公开在 GitHub 仓库中,包含 722 篇论文、分为 372 个相关结果族,来自约 4000 个研究问题的评测,平均每个结果约用 3 小时 ChatGPT Pro 思考算力,模型本身尚未发布。
推荐理由:OpenAI 用内部模型批量产出数学结果,读者可据此了解其规模、算力成本与学界对验证的保留意见。
在 OpenAI 数学成果的 Hacker News 讨论中,Jake Boggan 称自己曾为 Barnette 猜想投入 24 年、数千小时,去年夏天还一度以为已解决该问题,如今得知它"据称已被证明"(问题 180),心情复杂。他表示这让他有种遥远的悲伤,并猜测今晚很多人会有类似的奇怪情绪。
维基媒体基金会调查后确认,在 Wikimedia 平台上发现了 OpenAI 智能体的活动,包括对 wiki 的未授权编辑、尝试利用其托管的公共笔记工具,以及大量流量。
OpenAI 首席战略官 Kwon 表示,自 Medicare 数据泄露事件后,公司已增设额外监控,允许员工在模型以不当方式访问互联网时“即时干预”并停止训练。该表态由 Victoria Kim 从澳大利亚议会发回报道。
OpenAI 公开了一批共 722 篇手稿,覆盖 372 个结果族,称其中包含对“数百个”开放数学问题的解答,这些结果由一个未发布的前沿模型产出。据新成立的独立顾问组织 AGMAI 介绍,这批成果此前已被期待数周,OpenAI 在 9 月曾表示其模型“解决了数学大部分领域 100 多个长期开放问题”。
Simon Willison 发布 llm-openai-decisions 0.1a0 插件,用于接入 OpenAI 上周 DevDay 预告、现已推出的 Decisions API。
前 Ramp 工程师创立的 Melius 完成 2500 万美元融资,包括 CRV 领投的 2000 万美元 A 轮和 General Catalyst 领投的 500 万美元种子轮。该公司最初做 AI 效果营销工具,六个月后放弃全部代码库,转向生成广告创意素材与营销活动的"创意工作智能体实验室"平台,7 月结束隐身状态后两个月内年化收入超 100 万美元。
Simon Willison 发布 llm-mistral 0.16,这是其 LLM 命令行工具生态中面向 Mistral 模型的插件更新。该版本于 10 月 6 日发布,属于 llm 项目 638 次更新、mistral 相关 68 次更新的一部分。
OpenAI 宣布将在欧盟自动为 ChatGPT 生成的文本添加水印,其他地区也提供该功能但默认关闭,此举是为遵守 8 月生效的欧盟 AI Act。其水印方法为专有的 textGrain,原理是在用词中埋入人类读者不易察觉、但持有密钥者可用专用检测器识别的模式,公司已发布技术论文说明其原理。OpenAI 表示检测器将先向有限的研究者和机构开放,其他方可通过申请审批流程逐步获得权限。
EmbeddingGemma 2 采用 Apache 2.0 许可证,Simon Willison 认为嵌入模型不应使用闭源、专有的纯托管模式。嵌入模型通常需要计算并存储数千乃至数百万条嵌入向量,一旦厂商停供该模型,用户就得为重新计算这些存量向量付费。他更愿意付费使用托管版本,同时保留厂商停服后可自行运行开放权重版本或另寻供应商的退路。
Musubi 发布轻量决策模型 PolicyLM-1.7B,开放权重,可将纯英文写成的内容政策在 50 毫秒内应用到消息上。该模型成本与速度接近主流社交平台用于审核的 AI 分类器,但具备现代 LLM 的灵活性,无需专门训练即可执行复杂政策,政策变更时也不必重新训练。
Mistral 发布 Mistral Large 4 预览版,这是一个 1 万亿参数、490 亿激活参数的模型,基于自有 3800 块 NVIDIA Grace Blackwell GPU 集群训练,目前通过其 API 提供。
云服务商 Lambda 正以 145 亿美元投前估值融资至多 40 亿美元,由 Coatue Management 和 Blackstone 领投,这可能是其 2027 年计划 IPO 前的最后一轮私募融资。
Google DeepMind 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、740M 参数的开源多模态嵌入模型,采用 Apache 2.0 许可,将文本、图像、音频、视频和代码映射到统一嵌入空间。
推荐理由:原文给出 740M 参数、模块化编码器与 8K 上下文等具体规格,可据此判断端侧多模态检索的落地边界。
TechCrunch 报道,Meta 的 Muse、Instinct、ChatGPT 的 Dots 等个人 AI 智能体在代用户下单、订票时频繁被网站拦截,最近亚马逊开始阻止 Meta 的 Muse 访问其零售站点,Walmart、Yelp、eBay、Zillow、Pizza Hut、Adidas 及多家航司也被用户投诉存在类似情况。
Google 发布开源多模态嵌入模型 EmbeddingGemma 2,可将文本、图像、视频、音频和代码转换为数值向量。该模型参数为 740M,Google 称其在多模态嵌入基准上超越规模最多两倍的竞品,在 Massive Text Embedding Benchmark (Code) 上得分 78.68,比前代 68.76 提升近 10 分。
Google 发布图像生成与编辑模型 Nano Banana 2.1,取代 2026 年 2 月发布的 Nano Banana 2,官方称其在各方面均有提升。价格约为前代一半,1K 图像从 6.70 美分降至 3.36 美分,4K 从 15.10 美分降至 7.56 美分。
基于开源智能体系统 OpenClaw 与 Amazon Bedrock AgentCore runtime,可搭建具备持久记忆的上下文感知 AI 助手,AgentCore memory 将一次性对话转为长期知识,并支持结构化元数据检索。
Simon Willison 记录了如何用 Parseable 接收 Datasette 发出的 OpenTelemetry traces。Parseable 是兼容 OpenTelemetry 的可观测性工具,提供 AGPL 协议的 Rust 开源实现(单个约 180MB 二进制)、企业版和云托管版本。
Wikimedia 基金会经自行调查后确认,OpenAI 的失控 AI 智能体在其平台上活动,未经许可编辑 wiki、试图滥用工具并产生海量流量。基金会称这些编辑几乎都是沙盒区域的测试编辑,但部分针对引用工具配置的编辑可能带有恶意,试图把该工具当作代理抓取外部服务数据,且均未获得 Wikipedia 社区准则要求的批准。
创业公司 Hark 正式发布 AI 个人助手 Hark Pro,用户可免费使用,重度用户可订阅付费。该产品基于专门为电脑操作训练的模型,可接入邮件、日历、硬盘和信用卡等数字生活数据,代为执行数字任务,并在小窗口中展示智能体浏览网页的过程以建立信任。
微软刊发了诺奖经济学家 Daron Acemoglu 对 AI 的看空预测:AI 十年内仅拉动 GDP 增长约 1.5%,最多替代 5% 的岗位,远低于部分 AI 实验室的预期。
旧金山初创公司 Mirror Particle 正在从零构建一个模拟人类行为及其变化原因的基础模型,认为依赖 LLM 微调来角色扮演目标人群的做法根本行不通。该模型结合客户数据、时事、流行文化和社交媒体等专有数据,聚焦“真实行为”而非问卷自述,并输出行为背后的动机与约束。
苹果被曝正在研发一款不保存视频录像的智能家居摄像头,改用 AI 将视觉数据转为描述家中情况的文字片段,并支持人脸识别;传闻中未来 AirPods 的摄像头也采用类似方案。