Reflection 发布开源权重模型 Beam,主打低算力与编码智能体任务
AI 公司 Reflection 发布首个免费开放模型 Beam,这是一个总参数 501B、每 token 激活 23B 的 MoE 模型,面向编码、逻辑推理和智能体任务。
AI 公司 Reflection 发布首个免费开放模型 Beam,这是一个总参数 501B、每 token 激活 23B 的 MoE 模型,面向编码、逻辑推理和智能体任务。
Reflection AI 发布首款前沿开源权重模型 Beam,称其在高级推理基准上匹配领先中国开源模型,且推理算力消耗低 3-4 倍。Beam 是 5010 亿参数、230 亿激活参数的文本 MoE 模型,预训练 23.8 万亿 token,上下文窗口 100 万 token。
法国 AI 实验室 Mistral AI 于周二发布 Mistral Large 4(ML4),一款 1 万亿参数的大型多模态模型,昵称 Le Chonk,目前仅通过公开的 guardrail 端点访问,计划在安全测试完成后三周内开放权重。
Musubi 发布轻量决策模型 PolicyLM-1.7B,开放权重,可将纯英文写成的内容政策在 50 毫秒内应用到消息上。该模型成本与速度接近主流社交平台用于审核的 AI 分类器,但具备现代 LLM 的灵活性,无需专门训练即可执行复杂政策,政策变更时也不必重新训练。
Mistral 发布 Mistral Large 4 预览版,这是一个 1 万亿参数、490 亿激活参数的模型,基于自有 3800 块 NVIDIA Grace Blackwell GPU 集群训练,目前通过其 API 提供。
Google DeepMind 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、740M 参数的开源多模态嵌入模型,采用 Apache 2.0 许可,将文本、图像、音频、视频和代码映射到统一嵌入空间。
推荐理由:原文给出 740M 参数、模块化编码器与 8K 上下文等具体规格,可据此判断端侧多模态检索的落地边界。
Google 发布开源多模态嵌入模型 EmbeddingGemma 2,可将文本、图像、视频、音频和代码转换为数值向量。该模型参数为 740M,Google 称其在多模态嵌入基准上超越规模最多两倍的竞品,在 Massive Text Embedding Benchmark (Code) 上得分 78.68,比前代 68.76 提升近 10 分。
Google 发布图像生成与编辑模型 Nano Banana 2.1,取代 2026 年 2 月发布的 Nano Banana 2,官方称其在各方面均有提升。价格约为前代一半,1K 图像从 6.70 美分降至 3.36 美分,4K 从 15.10 美分降至 7.56 美分。
Mistral 发布迄今最大模型 Mistral Large 4(ML4),总参数 1 万亿、激活 49B,原生多模态,已在 Mistral Studio 开放 API 预览,权重预计 10 月底发布。
Mistral 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、49B 激活参数的原生多模态模型,权重将于本月底开放。
推荐理由:官方给出 1 万亿参数、49B 激活的开放权重模型在编码、智能体与网络安全上的基准表现,可据此判断开放权重模型的能力边界。
Falcon-Emirati-7B 发布,这是基于 Falcon-H1-Arabic 打造的阿联酋方言专用模型,目标是以母语者的方式理解和生成 Emirati Arabic 的词汇、语气与文化语境。
Reflection 发布 Beam,一个面向编码、智能体与科研的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,完整权重将以 Apache 2.0 在本月放出。
Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 训练,已在 Asta 的 Generate a report 功能中作为 Fast mode 上线,与 Claude 驱动的 Thinking mode 并列。
推荐理由:原文给出训练数据构造、引用过滤与评测细节,可了解小模型如何以 SFT 加 DPO 逼近专有模型报告质量。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作和网络防御,首批仅向 Fairwind 计划的政府用户与可信网络安全人员开放,后续再向开发者、企业和消费者开放。
推荐理由:汇总 Gemini 4 Argon 的基准、定价与可用范围,并对比同期 GPT-6.1 Sol 的成本表现。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者,起价为每百万输入 token 2 美元、每百万输出 token 10 美元,缓存输入 token 按输入价的 95% 折扣计费。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准成绩和分阶段开放路径,可据此判断前沿模型的能力边界与安全取舍。
Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使其在数字模型和合成出的实体蛋白质上均可验证,同时保留生物功能。
推荐理由:DeepMind 把水印从数字内容延伸到合成生物,读者可了解其在 DNA 合成筛查与数据库标注上的验证思路。
NVIDIA 发布 Kumo Tabular,这是 NVIDIA Kumo Structured 模型集合中的开源表格数据基础模型,已在 Hugging Face 上线。
推荐理由:表格基础模型用单次前向替代逐任务训练,三个尺寸与四个榜单排名给出了可比较的效率与精度参照。
H 公司发布 Holo4 系列智能体模型,包含 27B dense 与 35B-A3B MoE 两个版本,同时更新 Holotron 3 为 Holotron4 Nano。
推荐理由:Holo4 同时覆盖 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,可据此判断通用计算机智能体的成本与能力边界。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与逐行表演指导,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:官方给出两款 TTS 的定位差异、语音定制能力与上线渠道,可据此判断语音生成在创作与配音场景的可用性。
Google DeepMind 发布两款实时语音对话模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,前者面向规模化与成本效率,后者面向高复杂度任务和多步推理。
推荐理由:官方给出两款语音模型的基准成绩、定价定位与开放渠道,可据此判断语音智能体的落地节奏。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,通过从十亿参数 GigaPath 编码器蒸馏出的 22M 参数 ViT-S 主干大幅降低病理基础模型算力需求,并以 Apache 2.0 许可开源。