跳到正文
今天10月7日周三12 条
  1. TechCrunch · AI60

    HackerRank 将 AI 面试官 Chakra 正式开放给客户

    HackerRank 结束约六个月的 beta,于周一将 AI 面试官 Chakra 正式开放给客户。该 AI 智能体在候选人使用带 AI 助手的画布完成真实代码仓库任务时观察其过程,并追问思路,测试期间已完成超过 50 万场面试,Snowflake、Snorkel、Capgemini 等公司参与试用。

  2. TechCrunch · AI60

    TikTok 推出 AI 购物助手与一键结账

    TikTok 周一宣布推出 AI 购物助手和站内一键结账功能,用户可直接在品牌处完成购买。该购物助手是对话式 AI 智能体,能理解上下文并记住用户偏好,提供商品详情、物流、尺码、库存等实时购物指引。一键结账让用户可在 For You 信息流中一键下单,这些功能与 Salesforce、Shopify、Shoplazza、Stripe 等商务和支付平台合作构建。

  3. TechCrunch · AI60

    Instinct 将 AI 智能体引入群聊,未注册好友也能参与

    估值 100 亿美元的 AI 智能体 Instinct 宣布支持将智能体加入好友群聊,用于旅行规划、抢票、组织拼车等场景,好友即使没有注册 Instinct 账号也能参与。该功能今日起向早期访问用户开放,之后将扩展到全部用户。创始人 Noah Shinn 表示,个人智能体在连接群组智能体前会先征求用户许可,群组智能体与个人账号隔离、无法访问个人数据,用户也可随时取消对某个群组的信任。

  4. TechCrunch · AI60

    Hark 发布主打隐私的 AI 个人助手 Hark Pro

    创业公司 Hark 正式发布 AI 个人助手 Hark Pro,用户可免费使用,重度用户可订阅付费。该产品基于专门为电脑操作训练的模型,可接入邮件、日历、硬盘和信用卡等数字生活数据,代为执行数字任务,并在小窗口中展示智能体浏览网页的过程以建立信任。

  5. Microsoft Research20

    Microsoft 研究员 Jennifer Neville:AI 评测如何暴露模型的“意外失败”

    Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统突破传统 benchmark 的性能边界,以及模型在超出常规测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。

10月6日周二
  1. AWS Machine Learning Blog62

    GLM 5.3 上线 Amazon Bedrock

    智谱(Z.ai)的 GLM 5.3 已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码和长周期智能体任务,通过全托管 API 提供跨区域推理、提示词缓存和服务层级,目前面向符合条件的企业客户开放。

    推荐理由:GLM 5.3 在 Bedrock 上线,文中给出提示词缓存与跨区域推理的具体用法,可据此评估托管开源模型的接入成本。

  2. Google Research34

    Google 发布智能体隐私与安全报告:从上下文完整性视角探讨开放与新兴问题

    Google 发布《智能体隐私与安全中的开放与新兴问题:上下文视角》报告,汇集 50 多位学界与业界专家在 2025 年底纽约 CAPS 研讨会上的成果。报告基于上下文完整性(CI)理论,提出用上下文策略引擎在系统、模型、用户多层协同防御,应对提示注入、概率性控制流和自主委派等挑战。

10月5日周一
  1. GitHub Blog · AI & ML62

    GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准

    GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,研究预览版已上线网站。基准包含来自 187 个开源仓库、19 种语言的 219 个 pull request,其语言和仓库规模分布对齐 GitHub 上 103.9M 个真实 pull request,并采用多来源 golden set 与统一评分标准。

    推荐理由:GitHub 公开了代码审查基准的构建方法与评测口径,读者可据此理解 AI 代码审查能力如何被量化比较。

  2. MIT Technology Review · AI12

    从预测到自主决策:预测分析如何进入智能体 AI 时代

    企业 AI 的竞争焦点已从预测模型能否超越统计预测,转向如何让预测系统在不偏离业务意图的前提下自主行动。深度学习与生成式 AI 驱动的智能分析支持实时训练,使 AI 持续演进而非等待季度刷新,其数据来源也扩展到非结构化交互信息。Everest Group 合伙人 Vishal Gupta 认为,"分析"一词正在让位于 AI。

10月4日周日
  1. Hugging Face Blog72

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态评测 AI 智能体

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再依据终端后端状态和副作用而非生成的语句来评分,覆盖 507 个有状态业务流程、每个任务重复 20 次。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非工具调用判断成败,并给出 20 次重复的一致性数据。

10月3日周六
10月2日周五
  1. Hugging Face Blog41

    ServiceNow CoreAI 推出 AutoSynthData:为企业智能体生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功经验,自动生成并验证新的可执行训练任务,并随模型进步动态调整课程。该流程在 EnterpriseOps Gym 数据集上进行了演示,生成的任务需满足可行性、真实性与难度三项要求,验证器则需保证一致性、可靠性与完整性。

10月1日周四
  1. Google DeepMind87

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者,起价为每百万输入 token 2 美元、每百万输出 token 10 美元,缓存输入 token 按输入价的 95% 折扣计费。

    推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准成绩和分阶段开放路径,可据此判断前沿模型的能力边界与安全取舍。

9月30日周三