跳到正文
今天10月7日周三44 条
  1. Microsoft Research20

    Microsoft 研究员 Jennifer Neville:AI 评测如何暴露模型的“意外失败”

    Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统突破传统 benchmark 的性能边界,以及模型在超出常规测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。

  2. TechCrunch · AI38

    Anthropic 扩展 Claude for Startups 计划:免费一年 Claude Team 加 1000 美元 API 额度

    Anthropic 在 SF Tech Week 上宣布扩展 Claude for Startups 计划,为符合条件的初创公司提供免费一年的 Claude Team(最多五个高级席位)和 1000 美元 API 额度,并开放 Claude Marketplace 插件构建权限及 Applied AI 团队虚拟办公时间。申请条件为成立五年内或近两年获得融资的公司。

10月6日周二
  1. TechCrunch · AI42

    LibreOffice 称“无 AI”现已成为一项软件功能

    LibreOffice 背后的 The Document Foundation 宣布,在可预见的未来不会为这款开源文档编辑器加入 AI,默认安装将不含任何 AI 功能。该组织称这是“刻意的设计立场”,以确保用户文档不被上传至服务器处理,软件也无需联网即可运行;用户仍可通过安装扩展接入本地 AI 模型。

  2. The Decoder62

    韩国拟投 34.9 亿美元打造本土前沿 AI 模型以对标中国

    韩国计划通过政府股权投资 4.7 万亿韩元(约 34.9 亿美元)开发本土前沿模型,资金列入 2027 年预算草案,尚待国会批准。另一条资金线将支持韩国自研模型在本国经济中的采用,政府还将启动允许初创企业参与的公开竞赛,LG AI Research、SK Telecom 和 Upstage 三家现有竞赛入围者不会自动获得追加资金。

  3. AWS Machine Learning Blog62

    GLM 5.3 上线 Amazon Bedrock

    智谱(Z.ai)的 GLM 5.3 已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码和长周期智能体任务,通过全托管 API 提供跨区域推理、提示词缓存和服务层级,目前面向符合条件的企业客户开放。

    推荐理由:GLM 5.3 在 Bedrock 上线,文中给出提示词缓存与跨区域推理的具体用法,可据此评估托管开源模型的接入成本。

  4. Google Research34

    Google 发布智能体隐私与安全报告:从上下文完整性视角探讨开放与新兴问题

    Google 发布《智能体隐私与安全中的开放与新兴问题:上下文视角》报告,汇集 50 多位学界与业界专家在 2025 年底纽约 CAPS 研讨会上的成果。报告基于上下文完整性(CI)理论,提出用上下文策略引擎在系统、模型、用户多层协同防御,应对提示注入、概率性控制流和自主委派等挑战。

  5. The Verge · AI60

    Nolla Health 在犹他州试点 AI 开具痤疮处方

    医疗初创公司 Nolla Health 宣布,犹他州用户可通过其 App 扫描面部,由 AI 分析痤疮严重程度并自主开具处方。该试点前 100 名患者由两名医生审核每份处方,之后最多 500 名患者改为处方后审核,此后医生每月抽查至少 10% 的处方及所有升级或副作用案例。服务每月 4.99 美元,仅限 18 岁以上、轻中度痤疮的犹他州居民,AI 目前可开具八种皮肤治疗方案。

  6. The Verge · AI70

    AI 接管数学界引发的争议与风波

    过去一年,OpenAI、Anthropic 等实验室宣布在多个长期数学难题上取得突破,部分结果超出研究者对现有系统能力的预期,其中包括解决一个著名的千禧年大奖难题。但这些进展也引发学界反弹,AI 实验室表示正在从早前的失误中吸取教训,相关承诺能否兑现尚待观察。

10月5日周一
  1. GitHub Blog · AI & ML62

    GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准

    GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,研究预览版已上线网站。基准包含来自 187 个开源仓库、19 种语言的 219 个 pull request,其语言和仓库规模分布对齐 GitHub 上 103.9M 个真实 pull request,并采用多来源 golden set 与统一评分标准。

    推荐理由:GitHub 公开了代码审查基准的构建方法与评测口径,读者可据此理解 AI 代码审查能力如何被量化比较。

  2. MIT Technology Review · AI12

    从预测到自主决策:预测分析如何进入智能体 AI 时代

    企业 AI 的竞争焦点已从预测模型能否超越统计预测,转向如何让预测系统在不偏离业务意图的前提下自主行动。深度学习与生成式 AI 驱动的智能分析支持实时训练,使 AI 持续演进而非等待季度刷新,其数据来源也扩展到非结构化交互信息。Everest Group 合伙人 Vishal Gupta 认为,"分析"一词正在让位于 AI。

  3. NVIDIA Blog22

    NVIDIA Inception 初创公司如何用 AI 补齐乳腺癌诊疗缺口

    NVIDIA Inception 计划中的多家初创公司正用 AI 覆盖乳腺癌筛查、风险评估与治疗规划环节。iSono Health 的 FDA 认证 ATUSA 可穿戴 3D 超声系统约两分钟完成单侧乳房扫描,公司称灵敏度比手持 2D 超声高 28%;Whiterabbit.ai 的 WRDensity 已用于数十万患者;Ataraxis AI 则用病理切片预测治疗反应与复发风险。

  4. MIT Technology Review · AI22

    人们一边痛恨 AI,一边为何又离不开它?

    全球对 AI 的态度正陷入矛盾:Pew 调查显示更多美国成年人认为 AI 对个人和社会的影响偏负面,斯坦福报告称全球超半数人对 AI 产品感到紧张,但 ChatGPT 在 5 月月活突破 10 亿,Gemini 7 月达 9.5 亿用户,Pew 数据显示一半美国成年人已在用聊天机器人。作者认为,人们反感的不是技术本身,而是科技公司无孔不入的推销方式。