跳到正文

技术方向

部署工程 最新动态

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

13 条精选近 30 天 11 条共收录 47 条

更新

部署工程的精选

10月6日周二第 1–13 条
  1. AWS Machine Learning Blog62

    GLM 5.3 上线 Amazon Bedrock

    智谱(Z.ai)的 GLM 5.3 已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码和长周期智能体任务,通过全托管 API 提供跨区域推理、提示词缓存和服务层级,目前面向符合条件的企业客户开放。

    推荐理由:GLM 5.3 在 Bedrock 上线,文中给出提示词缓存与跨区域推理的具体用法,可据此评估托管开源模型的接入成本。

10月3日周六
  1. OpenAI News60

    OpenAI 发布 GPT-6 家族模型使用指南

    OpenAI 发布 GPT-6 家族模型指南,面向初创公司讲解如何选择 GPT-6 模型、调节推理强度、改进提示词与技能、协调工具,并为生产环境准备工作流。

    推荐理由:OpenAI 官方给出 GPT-6 家族的选型与调优路径,适合正在把模型接入生产工作流的团队参考。

10月2日周五
  1. Google Research62

    Google 发布基于 TEE 的新一代联邦学习系统,Gboard 已采用

    Google Research 发布新一代联邦学习系统,利用可信执行环境(TEE)为数据匿名化提供可验证、可审计的保证,并已由 Gboard 采用。该系统通过访问策略公开透明日志、KMS 密钥管理和 TEE 内 Python 训练程序执行,使加密训练数据只能在符合访问策略的 TEE 中解密处理。

    推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的实际部署结果。

  2. NVIDIA Blog62

    NVIDIA DGX Spark 推出 64GB 版本,支持双机集群扩展本地 AI

    NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 64GB 统一内存版 DGX Spark,10 月 23 日开售,起售价 4,999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 与完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备本地运行。

    推荐理由:原文给出 64GB 新配置的定价、上市时间与双机集群方式,读者可据此判断本地跑大模型的门槛。

  3. NVIDIA Blog80

    NVIDIA GPU 如何加速 OpenAI GPT-6 Astra Ultrafast

    GPT-6 Astra Ultrafast 已在 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户中开放,运行在 NVIDIA Blackwell GPU 上,token 生成速度最高比 Astra Standard 模式快 8 倍。

    推荐理由:原文给出 Astra Ultrafast 相对标准模式的加速倍数与开放入口,读者可据此判断它对编码智能体循环的实际影响。

10月1日周四
9月28日周一
9月24日周四
  1. Microsoft Research60

    微软研究院:将物理 AI 推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院对移动操作机器人工作负载做了首次系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU,可提升任务成功率、支持更大模型并延长续航。

    推荐理由:微软研究院系统测量了机器人端侧推理的性能与续航代价,并给出可复用的卸载工具链,适合关注具身智能系统架构的读者。

  2. Google DeepMind62

    Google 为 Private AI Compute 引入安全服务端持久记忆

    Google Private AI Compute 团队公布为 Private AI Compute 平台引入私有服务端记忆的技术方案,让云端 AI 助手能在跨设备场景下持久保留上下文,同时维持端侧级别的隐私标准。

    推荐理由:Google 给出私有 AI 计算新增持久化服务端记忆的架构细节,可据此理解云端助手如何在跨设备场景下保留上下文。

9月17日周四
  1. GitHub Blog · AI & ML85

    GitHub 用 Copilot 把 Copilot 运行时迁移到 Rust

    GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体写了大部分代码,分布在 128 个 PR 中增量合入 main,而非一次性切换。

    推荐理由:作者以亲历者身份复盘用 AI 智能体把 80 万行运行时从 TypeScript 迁到 Rust 的完整工程方法,可迁移到大规模重构。

9月9日周三
  1. Mistral AI60

    Mistral 用 AI 智能体迁移 4 万行 Fortran 77 遗留代码

    Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件也没有集中文档。团队先搭建数值对齐测试框架,用自定义解析器生成调用树并派出上百个智能体补文档,最终采用人工把关的 coder、tester、reviewer 智能体工作流逐模块迁移。

    推荐理由:Mistral 公开了用智能体迁移 4 万行 Fortran 的完整工作流,其中先建数值对齐测试再迁移的做法可直接迁移到其他遗留系统改造。

8月20日周四
  1. Mistral AI71

    Mistral 发布 Agentic Search,用多步检索循环替代一次性 RAG

    Mistral 发布 Agentic Search,作为检索层让模型在多步循环中查找、打开、导航、阅读和校验复杂文档中的信息,通过 Mistral Search Toolkit 提供,并内置在 Studio 和 Vibe 的 Libraries 中。

    推荐理由:原文给出多步检索循环在 FinanceBench 与 OfficeQA Pro 上的准确率、token 与延迟变化,可据此判断它与一次性 RAG 的差别。

7月29日周三