Falcon-Emirati-7B:让 LLM 学会阿联酋方言、文化与语感
Falcon-Emirati-7B 发布,这是基于 Falcon-H1-Arabic 打造的阿联酋方言专用模型,目标是以母语者的方式理解和生成 Emirati Arabic 的词汇、语气与文化语境。
Falcon-Emirati-7B 发布,这是基于 Falcon-H1-Arabic 打造的阿联酋方言专用模型,目标是以母语者的方式理解和生成 Emirati Arabic 的词汇、语气与文化语境。
智谱(Z.ai)的 GLM 5.3 已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码和长周期智能体任务,通过全托管 API 提供跨区域推理、提示词缓存和服务层级,目前面向符合条件的企业客户开放。
推荐理由:GLM 5.3 在 Bedrock 上线,文中给出提示词缓存与跨区域推理的具体用法,可据此评估托管开源模型的接入成本。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再依据终端后端状态和副作用而非生成的语句来评分,覆盖 507 个有状态业务流程、每个任务重复 20 次。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非工具调用判断成败,并给出 20 次重复的一致性数据。
Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 训练,已在 Asta 的 Generate a report 功能中作为 Fast mode 上线,与 Claude 驱动的 Thinking mode 并列。
推荐理由:原文给出训练数据构造、引用过滤与评测细节,可了解小模型如何以 SFT 加 DPO 逼近专有模型报告质量。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功经验,自动生成并验证新的可执行训练任务,并随模型进步动态调整课程。该流程在 EnterpriseOps Gym 数据集上进行了演示,生成的任务需满足可行性、真实性与难度三项要求,验证器则需保证一致性、可靠性与完整性。
Hugging Face 发布 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,单模型评测耗时从数周投票缩短到数小时。
NVIDIA 发布 Kumo Tabular,这是 NVIDIA Kumo Structured 模型集合中的开源表格数据基础模型,已在 Hugging Face 上线。
推荐理由:表格基础模型用单次前向替代逐任务训练,三个尺寸与四个榜单排名给出了可比较的效率与精度参照。
Hugging Face 博客介绍论文 ProvenanceGuard,一个面向 MCP 智能体的生成后验证层,可在不重训智能体的前提下读取 MCP 调用轨迹,逐条核查答案中的声明是否由其所声称的来源支持,以识别"跨来源混淆"。
H 公司发布 Holo4 系列智能体模型,包含 27B dense 与 35B-A3B MoE 两个版本,同时更新 Holotron 3 为 Holotron4 Nano。
推荐理由:Holo4 同时覆盖 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,可据此判断通用计算机智能体的成本与能力边界。