Pinterest 用 AI 把美妆 Pin 图变成可执行的美发美甲方案
Pinterest 推出由视觉智能与生成式 AI 技术 Pinterest Intelligence 驱动的 Beauty Guides,可将美发美甲类 Pin 图转成沙龙可用的具体方案。
Pinterest 推出由视觉智能与生成式 AI 技术 Pinterest Intelligence 驱动的 Beauty Guides,可将美发美甲类 Pin 图转成沙龙可用的具体方案。
法国 AI 实验室 Mistral AI 于周二发布 Mistral Large 4(ML4),一款 1 万亿参数的大型多模态模型,昵称 Le Chonk,目前仅通过公开的 guardrail 端点访问,计划在安全测试完成后三周内开放权重。
Google DeepMind 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、740M 参数的开源多模态嵌入模型,采用 Apache 2.0 许可,将文本、图像、音频、视频和代码映射到统一嵌入空间。
推荐理由:原文给出 740M 参数、模块化编码器与 8K 上下文等具体规格,可据此判断端侧多模态检索的落地边界。
Google 发布开源多模态嵌入模型 EmbeddingGemma 2,可将文本、图像、视频、音频和代码转换为数值向量。该模型参数为 740M,Google 称其在多模态嵌入基准上超越规模最多两倍的竞品,在 Massive Text Embedding Benchmark (Code) 上得分 78.68,比前代 68.76 提升近 10 分。
Mistral 发布迄今最大模型 Mistral Large 4(ML4),总参数 1 万亿、激活 49B,原生多模态,已在 Mistral Studio 开放 API 预览,权重预计 10 月底发布。
Mistral 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、49B 激活参数的原生多模态模型,权重将于本月底开放。
推荐理由:官方给出 1 万亿参数、49B 激活的开放权重模型在编码、智能体与网络安全上的基准表现,可据此判断开放权重模型的能力边界。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者,起价为每百万输入 token 2 美元、每百万输出 token 10 美元,缓存输入 token 按输入价的 95% 折扣计费。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准成绩和分阶段开放路径,可据此判断前沿模型的能力边界与安全取舍。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据联合训练的生物世界模型,以及连接模型、科学工具、文献与湿实验的交互式 harness 组成。
推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环,并给出胰腺癌化合物筛选的湿实验验证结果。
Google Research 发布 AI video co-director,一个构建在 Gemini 和 Veo 之上的多智能体编排框架,用于生成连贯的多镜头长视频,并原生继承 SynthID 水印等安全机制。
推荐理由:Google 把长视频生成拆成四个可组合框架,并给出多镜头一致性的评测基准与量化结果。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的原生实时对话模型上加入近实时视频生成,实现带口型同步、自然表情和流畅轮次的视觉化对话。
推荐理由:官方给出 Live Avatar 的实时视频对话能力、异步工具调用与 97 种语言同步等具体细节,可据此判断企业级多模态交互的落地形态。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与逐行表演指导,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:官方给出两款 TTS 的定位差异、语音定制能力与上线渠道,可据此判断语音生成在创作与配音场景的可用性。
Google Research 发布研究实验,让教师借助生成式 UI(GenUI)按自身课程目标动态生成互动式学习模拟,并同步开放 30 多个面向初高中 STEM 的英文学习互动样例库。