AWS 开源 Strands Decider 2B 决策模型
AWS 发布开源决策模型 Strands Decider 2B,灵感来自 TypeSafe 的 Jev,可在预设选项间快速排序并输出置信度,小到可本地运行。该模型基于 Qen3.5-2B 的"躯干"构建,由杰出工程师 Marc Brooker 的业余项目演化而来,曾登上 Jevbench 同规模模型榜首;他称其能借助置信度和封闭答案域为 Agent 工作流提供更低延迟、更低成本且更可靠的步骤决策。
AWS 发布开源决策模型 Strands Decider 2B,灵感来自 TypeSafe 的 Jev,可在预设选项间快速排序并输出置信度,小到可本地运行。该模型基于 Qen3.5-2B 的"躯干"构建,由杰出工程师 Marc Brooker 的业余项目演化而来,曾登上 Jevbench 同规模模型榜首;他称其能借助置信度和封闭答案域为 Agent 工作流提供更低延迟、更低成本且更可靠的步骤决策。
NVIDIA 发布开源表格基础模型 Kumo Tabular,对带标签的表格数据在单次前向传播中完成分类或回归预测,无需训练、调参或特征工程。
推荐理由:官方发布开放表格基础模型,用上下文学习免训练预测,作者给出了架构细节和基准表现,读者可以评估它是否适合替换现有梯度提升树流程。
Claude Opus 5.5 本周发布,社区反响热烈,尤其被认为擅长制作解释视频。它在 SimpleBench 上以 88.4% 领跑,视觉评测被评为 Anthropic 迄今最佳视觉模型,成本比 Fable 5.1 低约 60%。此外,GPT-6 系列、Gemini 3.8 Flash、小米 MiMo-V2.6-Pro(MIT 开源、1M 上下文)等同周亮相。
Hcompany 发布 Holo4 智能体系列模型,含 27B dense 和 35B-A3B MoE 两个尺寸,并更新发布 Holotron4 Nano。模型可通过 GUI、代码、MCP 和 API 多种接口操作软件,在 OSWorld 2.0 上 Holo4 27B 得分 61.7%(Opus 5.5 为 81.8%),35B-A3B 达 30.9%,参数量和成本显著更低。
推荐理由:原文给出 OSWorld 2.0 等基准分数、成本对比和全部轨迹开源信息,读者可以据此评估这款多接口智能体模型是否适配自己的业务工作流。
Liquid AI 发布面向视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下换取加速。
推荐理由:原文给出视觉 DSpark 草稿模型的架构细节、实测加速数字和三大推理框架接入方式,读者可评估端侧 VLM 推理加速的可迁移做法。
Xiaomi 发布 MiMo-V2.6 系列,含 Pro、Flash 两个原生全模态模型及 20 倍加速输出的 Pro-UltraSpeed,MiMo-V2.6-Pro 以 1.02T 总参数/42B 激活参数登上 Artificial Analysis Intelligence Index 开源权重模型榜首(46 分)。
推荐理由:汇总了 MiMo-V2.6-Pro 的开源权重、价格与 RL 训练细节,读者可以了解小米进入前沿模型行列的具体依据。
H Company 发布 NeoMME 系列 260M 和 800M 多语言多模态编码器,用单个双向 Transformer 处理文本和 32×32 图像 patch,从零以掩码离散扩散目标训练,无需独立视觉塔或因果语言模型。
Google Research 发布时间序列基础模型 TimesFM-3,参数量 3.3 亿,预训练语料超过 1 万亿时间点,原生支持零样本多变量预测。模型可同时预测多个目标序列,支持过去协变量与过去-未来协变量,通过交替注意力与 Contiguous Patch Masking 在单次前向传播中完成整段预测,每步输出第 10 到第 90 百分位共 9 个分位数。
Microsoft Research 联合华盛顿大学和 Providence 发布 GigaPath-Flash 与 GigaTIME-Flash,以 Apache 2.0 许可在 HuggingFace 开放权重。
IBM 发布 Granite 4.2 推理模型家族,含 3B、8B、30B 三个稠密模型,以 Apache 2.0 许可开源。
推荐理由:IBM 官方公开 Granite 4.2 从预训练到多阶段 RL 的完整训练细节,读者可以借此了解推理模型的可复现构建路径。
Meta 发布 30B 参数开源多模态模型 Muse Glimmer,从 Muse 蒸馏而来,采用 Apache 2.0 许可,定位于本地智能体场景如编码、文档分析和个人助理。
推荐理由:原文给出架构细节、跑分对比和多套部署方案,读者可据此评估其在本地多模态智能体场景的可用性。
Mistral 发布 3B 开源多模态安全分类模型 Shieldstral,以 Apache 2.0 权重开放下载。它把内容审核建模为策略自适应的问答任务,推理时用自然语言写入审核政策即可返回校准的安全分数,无需重训练,可统一处理文本、图像及提示-回复对。官方称其在文本安全、拒答检测和多模态审核上匹配或超过最大 7 倍于其体积的开源护栏模型,可在单张 16GB GPU 上运行。
Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,总参数 975B、激活 41B 的 MoE 架构,原生接受图像、文本和音频输入,支持 1M 上下文窗口,训练数据为 45 万亿 token。
推荐理由:原文给出架构细节、各档位 VRAM 部署配置和多模态评测数据,对评估落地成本和选择变体有直接参考。
Google Research 发布面向表格数据分类与回归的零样本基础模型 TabFM,将表格预测重构为上下文学习问题,免去人工训练、调参和特征工程。
推荐理由:官方介绍了把表格预测重构为上下文学习问题的模型设计、合成数据训练方式和 TabArena 基准结果,读者可据此评估其对传统表格机器学习流程的影响。
PaddlePaddle 发布 PP-OCRv6,提供 tiny、small、medium 三档模型,参数量从 1.5M 到 34.5M,medium 和 small 档支持 50 种语言。
智谱发布旗舰模型 GLM-5.2,面向长时程任务,首次在稳定的 1M-token 上下文上交付该能力,采用 MIT 开源协议。架构上提出 IndexShare,每 4 层稀疏注意力共享一个 indexer,1M 上下文下每 token FLOPs 降低 2.9 倍,并改进 MTP 层使投机解码接受长度最多提升 20%。
推荐理由:官方技术报告给出 1M 上下文的架构改进和三项长时程基准对比,读者可以借此评估开源模型在真实编码场景的可用性。
Google DeepMind 发布基于文本扩散的开源实验模型 DiffusionGemma,采用 Apache 2.0 协议,权重已在 Hugging Face 上提供。
推荐理由:官方说明了文本扩散模型的架构取舍与适用场景,读者可据此判断它是否适合本地低并发的高吞吐需求。
Google DeepMind 发布 Gemma 4 12B,采用无编码器的统一多模态架构,视觉和音频输入直接进入 LLM backbone,支持原生音频输入。
推荐理由:原文给出了架构细节、内存门槛和许可证等可验证事实,读者可据此评估本地部署多模态模型的可行性。
Hcompany 发布 Holo3.1 系列 Computer Use 模型,提供 0.8B、4B、9B 和 35B-A3B 四种尺寸。
推荐理由:官方给出各尺寸在 OSWorld 与 AndroidWorld 的量化后表现和部署路径,读者可据此评估本地 Computer Use Agent 的可行性。
JetBrains 发布 Mellum2,一个总参数 12B、每 token 仅激活 2.5B 的开源 Mixture-of-Experts 模型,在自然语言和代码语料上从头训练,采用 Apache 2.0 许可证。
Hugging Face 的 Tom Aarsen 发布 ettin-reranker-v1 系列,含 17M 到 1B 六个 Sentence Transformers CrossEncoder 重排序模型,基于 Ettin ModernBERT 编码器,Apache 2.0 许可,支持最长 8192 token 上下文。
推荐理由:作者公开了六个模型、完整训练脚本和1.43亿条蒸馏数据,并给出与主流reranker的速度和精度对比,便于按规模选型或自行复现训练。
IBM 发布 Granite Embedding Multilingual R2 两款 Apache 2.0 多语言嵌入模型:97M 紧凑版在 MTEB Multilingual Retrieval 得 60.3。
推荐理由:原文给出完整基准数据、训练方法与框架集成示例,读者可按规模和场景直接选型。
IBM Granite 团队发布 Granite 4.1 系列 dense 模型,含 3B、8B、30B 三个规模,在约 15T tokens 上训练,上下文经长文本扩展达 512K,均以 Apache 2.0 许可开源。
推荐理由:原文完整披露了五阶段预训练、SFT 质控和四阶段 RL 的训练配方,8B 稠密模型对标上一代 32B-A9B MoE 的结果也可供选型参考。
DeepSeek 发布 V4,在 Hub 上开源 DeepSeek-V4-Pro(1.6T 总参数 / 49B 激活)和 DeepSeek-V4-Flash(284B 总参数 / 13B 激活)两个 instruct 及对应 base 检查点,均支持 1M token 上下文。
推荐理由:文章拆解了 V4 为长上下文与 Agent 场景做的架构与后训练设计,读者可据此评估开源模型跑长任务的部署成本。
Google DeepMind 发布 Gemma 4 开源模型,基于 Gemini 3 技术,主打高级推理和智能体工作流。提供 E2B、E4B、26B MoE(推理时仅激活 3.8B 参数)和 31B Dense 四种尺寸,31B 在 Arena AI 文本排行榜上位列全球开源模型第 3,采用 Apache 2.0 许可,支持 128K-256K 上下文窗口、原生多模态和 140+ 语言。
推荐理由:原文给出了四个尺寸、基准排名和部署细节,读者可以据此判断在本地和端侧硬件上的可用性。
Google DeepMind 发布 Gemma 4 多模态模型系列,共五个尺寸(E2B、E4B、12B Unified、31B、26B A4B MoE),采用 Apache 2.0 许可,支持图像、文本和音频输入,上下文窗口最高 256K。
推荐理由:Hugging Face 官方详解 Gemma 4 架构、多模态能力与全生态部署方式,还覆盖 DiffusionGemma 和推理加速等上手细节。
IBM 发布 Granite 4.0 3B Vision,一个面向企业文档理解的小型视觉语言模型,以 LoRA 适配器形式叠加在 Granite 4.0 Micro 上,主打表格提取、图表理解和语义键值对提取。
Mistral AI 发布首款文生语音模型 Voxtral TTS,4B 参数,支持 9 种语言,仅需约 3 秒参考音频即可适配自定义音色,并支持零样本跨语言音色迁移。
推荐理由:原文给出 9 语言、3 秒参考音色、70ms 延迟等可核验细节与人类评测对比,读者可据此评估其语音智能体方案。
H Company 发布多模态计算机使用模型 Holotron-12B,基于 NVIDIA Nemotron-Nano-2 VL 后训练约 140 亿 token,已在 Hugging Face 以 NVIDIA Open Model License 开放。
Mistral 发布 Mistral Small 4,首次将 Magistral 的推理、Pixtral 的多模态和 Devstral 的编码能力统一到单一模型,采用 Apache 2.0 许可开源。
推荐理由:官方宣布 Small 家系统一推理、多模态与编码能力,并给出架构参数和推理效率对比,便于评估开源部署性价比。
Google 开发的开源 AI 模型 SpeciesNet 可对相机陷阱图像中约 2,500 类(2,498 类)动物进行分类,训练数据超过 6500 万张标注图像。模型在留出测试集上能找出 99.4% 含动物的图像,可识别到物种级的预测中 94.5% 正确,标准笔记本每天约可处理 3 万张图像。过去一年,全球研究团队已用它在坦桑尼亚塞伦盖蒂、哥伦比亚、澳大利亚等地分析数百万张野生动物影像。
Mistral 发布 Voxtral Transcribe 2 系列,包含批处理转写模型 Voxtral Mini Transcribe V2 和实时模型 Voxtral Realtime。
推荐理由:官方发布了两个语音转写模型的具体性能、价格和开放权重信息,读者可以据此对比现有转写方案的成本与延迟。
H 公司发布其最大的 UI 定位模型 Holo2-235B-A22B Preview,在 ScreenSpot-Pro 达到 78.5%、OSWorld G 达到 79.0%,创下 SOTA 纪录。该模型采用智能体定位方式迭代修正预测,带来 10-20% 相对提升,已作为研究版本在 Hugging Face 开放。训练使用 SkyPilot 统一管理跨云的 Kubernetes 集群任务。
Overworld 发布实时交互式视频扩散模型 Waypoint-1,可通过文本、鼠标和键盘交互生成可进入的虚拟世界。
推荐理由:原文给出训练方法、推理库与帧率数据,并解释它与微调路线世界模型在控制延迟上的差异。
NVIDIA 发布 Cosmos Reason 2,一个面向物理 AI 的开源推理视觉语言模型,登顶 Physical AI Bench 和 Physical Reasoning 排行榜,成为视觉理解排名第一的开源模型。
推荐理由:官方发布给出模型规格、上下文长度和评测变化,读者可据此评估其是否适合机器人与视频分析场景。
Hugging Face 博客宣布推出 Falcon-H1-Arabic 阿拉伯语模型家族,包含 3B、7B、34B 三种规格,采用融合 Mamba(State Space Model)与 Transformer 注意力的混合架构。
Mistral AI 发布开源编码模型 Devstral 2(123B)和 Devstral Small 2(24B),SWE-bench Verified 分别取得 72.2% 和 68.0%,并推出开源终端编码智能体 Mistral Vibe CLI。
推荐理由:官方公布两个尺寸开源编码模型的基准成绩、许可与部署门槛,并同步开放终端 CLI,读者可评估其替代现有方案的成本。
Intel AI 软件团队推出 DeepMath,一个基于 Qwen3-4B Thinking、用 GRPO 微调并通过 smolagents 实现的数学推理智能体。模型用简短 Python 代码片段替代冗长文本推理,在沙箱中执行后回填推理上下文,输出长度最多减少 66%,同时常提升准确率。在 MATH500、AIME、HMMT、HLE 四个数据集上,GRPO 训练与智能体推理结合取得最高准确率。
Mistral 发布 Mistral 3 系列模型,包括 41B 激活、675B 总参数的 MoE 模型 Mistral Large 3,以及 3B/8B/14B 三种尺寸的 Ministral 3 小模型,全部以 Apache 2.0 协议开源。
推荐理由:官方发布涵盖 Large 3 与 Ministral 3 全系的参数规模、开源协议和部署途径,读者可以据此判断各档模型适合的场景。
SLAM Lab 发布 Apriel-H1 系列,将 15B 推理模型部分注意力层替换为 Mamba,旗舰 Apriel-H1-15b-Thinker-SFT 以 76.8B token 训练实现 2.1 倍吞吐且推理质量损失很小。