跳到正文

#开源生态

今日 1 条
今天10月2日周五
  1. TechCrunch · AI52

    AWS 开源 Strands Decider 2B 决策模型

    AWS 发布开源决策模型 Strands Decider 2B,灵感来自 TypeSafe 的 Jev,可在预设选项间快速排序并输出置信度,小到可本地运行。该模型基于 Qen3.5-2B 的"躯干"构建,由杰出工程师 Marc Brooker 的业余项目演化而来,曾登上 Jevbench 同规模模型榜首;他称其能借助置信度和封闭答案域为 Agent 工作流提供更低延迟、更低成本且更可靠的步骤决策。

9月29日周二
  1. Hugging Face Blog60

    NVIDIA 开源表格基础模型 Kumo Tabular,单次前向预测登顶四大基准

    NVIDIA 发布开源表格基础模型 Kumo Tabular,对带标签的表格数据在单次前向传播中完成分类或回归预测,无需训练、调参或特征工程。

    推荐理由:官方发布开放表格基础模型,用上下文学习免训练预测,作者给出了架构细节和基准表现,读者可以评估它是否适合替换现有梯度提升树流程。

  2. Latent Space37

    Claude Opus 5.5 擅长制作解释视频

    Claude Opus 5.5 本周发布,社区反响热烈,尤其被认为擅长制作解释视频。它在 SimpleBench 上以 88.4% 领跑,视觉评测被评为 Anthropic 迄今最佳视觉模型,成本比 Fable 5.1 低约 60%。此外,GPT-6 系列、Gemini 3.8 Flash、小米 MiMo-V2.6-Pro(MIT 开源、1M 上下文)等同周亮相。

9月28日周一
  1. Hugging Face Blog67

    Hcompany 发布 Holo4 智能体系列,含 27B 与 35B-A3B 两个版本并开源全部轨迹

    Hcompany 发布 Holo4 智能体系列模型,含 27B dense 和 35B-A3B MoE 两个尺寸,并更新发布 Holotron4 Nano。模型可通过 GUI、代码、MCP 和 API 多种接口操作软件,在 OSWorld 2.0 上 Holo4 27B 得分 61.7%(Opus 5.5 为 81.8%),35B-A3B 达 30.9%,参数量和成本显著更低。

    推荐理由:原文给出 OSWorld 2.0 等基准分数、成本对比和全部轨迹开源信息,读者可以据此评估这款多接口智能体模型是否适配自己的业务工作流。

9月24日周四
9月22日周二
  1. Latent Space79

    Xiaomi 发布 MiMo-V2.6-Pro 1T-A42B 开源全模态模型,训练成本约 300 万美元

    Xiaomi 发布 MiMo-V2.6 系列,含 Pro、Flash 两个原生全模态模型及 20 倍加速输出的 Pro-UltraSpeed,MiMo-V2.6-Pro 以 1.02T 总参数/42B 激活参数登上 Artificial Analysis Intelligence Index 开源权重模型榜首(46 分)。

    推荐理由:汇总了 MiMo-V2.6-Pro 的开源权重、价格与 RL 训练细节,读者可以了解小米进入前沿模型行列的具体依据。

9月3日周四
9月1日周二
  1. Google Research53

    Google 发布 3.3 亿参数时间序列基础模型 TimesFM-3,支持零样本多变量预测

    Google Research 发布时间序列基础模型 TimesFM-3,参数量 3.3 亿,预训练语料超过 1 万亿时间点,原生支持零样本多变量预测。模型可同时预测多个目标序列,支持过去协变量与过去-未来协变量,通过交替注意力与 Contiguous Patch Masking 在单次前向传播中完成整段预测,每步输出第 10 到第 90 百分位共 9 个分位数。

8月25日周二
8月10日周一
8月4日周二
  1. Mistral AI58

    Mistral 发布开源多模态安全分类模型 Shieldstral,Apache 2.0 权重可自由下载

    Mistral 发布 3B 开源多模态安全分类模型 Shieldstral,以 Apache 2.0 权重开放下载。它把内容审核建模为策略自适应的问答任务,推理时用自然语言写入审核政策即可返回校准的安全分数,无需重训练,可统一处理文本、图像及提示-回复对。官方称其在文本安全、拒答检测和多模态审核上匹配或超过最大 7 倍于其体积的开源护栏模型,可在单张 16GB GPU 上运行。

7月15日周三
  1. Hugging Face Blog81

    Thinking Machines 发布万亿参数开源多模态模型 Inkling 及 Inkling-Small

    Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,总参数 975B、激活 41B 的 MoE 架构,原生接受图像、文本和音频输入,支持 1M 上下文窗口,训练数据为 45 万亿 token。

    推荐理由:原文给出架构细节、各档位 VRAM 部署配置和多模态评测数据,对评估落地成本和选择变体有直接参考。

6月30日周二
  1. Google Research63

    Google 发布表格数据零样本基础模型 TabFM

    Google Research 发布面向表格数据分类与回归的零样本基础模型 TabFM,将表格预测重构为上下文学习问题,免去人工训练、调参和特征工程。

    推荐理由:官方介绍了把表格预测重构为上下文学习问题的模型设计、合成数据训练方式和 TabArena 基准结果,读者可据此评估其对传统表格机器学习流程的影响。

6月22日周一
6月17日周三
  1. Hugging Face Blog77

    智谱发布旗舰模型 GLM-5.2,主打 1M 上下文长时程任务

    智谱发布旗舰模型 GLM-5.2,面向长时程任务,首次在稳定的 1M-token 上下文上交付该能力,采用 MIT 开源协议。架构上提出 IndexShare,每 4 层稀疏注意力共享一个 indexer,1M 上下文下每 token FLOPs 降低 2.9 倍,并改进 MTP 层使投机解码接受长度最多提升 20%。

    推荐理由:官方技术报告给出 1M 上下文的架构改进和三项长时程基准对比,读者可以借此评估开源模型在真实编码场景的可用性。

6月11日周四
6月9日周二
6月2日周二
6月1日周一
5月19日周二
  1. Hugging Face Blog66

    Hugging Face 发布 Ettin Reranker 系列:6 个 Apache 2.0 交叉编码器重排序模型

    Hugging Face 的 Tom Aarsen 发布 ettin-reranker-v1 系列,含 17M 到 1B 六个 Sentence Transformers CrossEncoder 重排序模型,基于 Ettin ModernBERT 编码器,Apache 2.0 许可,支持最长 8192 token 上下文。

    推荐理由:作者公开了六个模型、完整训练脚本和1.43亿条蒸馏数据,并给出与主流reranker的速度和精度对比,便于按规模选型或自行复现训练。

5月15日周五
4月29日周三
  1. Hugging Face Blog64

    IBM Granite 4.1 系列模型发布并详解训练过程

    IBM Granite 团队发布 Granite 4.1 系列 dense 模型,含 3B、8B、30B 三个规模,在约 15T tokens 上训练,上下文经长文本扩展达 512K,均以 Apache 2.0 许可开源。

    推荐理由:原文完整披露了五阶段预训练、SFT 质控和四阶段 RL 的训练配方,8B 稠密模型对标上一代 32B-A9B MoE 的结果也可供选型参考。

4月24日周五
  1. Hugging Face Blog83

    DeepSeek 发布 V4:MoE 双检查点上线 Hub,主打百万 token 上下文的 Agent 能力

    DeepSeek 发布 V4,在 Hub 上开源 DeepSeek-V4-Pro(1.6T 总参数 / 49B 激活)和 DeepSeek-V4-Flash(284B 总参数 / 13B 激活)两个 instruct 及对应 base 检查点,均支持 1M token 上下文。

    推荐理由:文章拆解了 V4 为长上下文与 Agent 场景做的架构与后训练设计,读者可据此评估开源模型跑长任务的部署成本。

4月3日周五
  1. Google DeepMind79

    Google DeepMind 发布 Gemma 4 开源模型,E2B/E4B/26B MoE/31B 四尺寸

    Google DeepMind 发布 Gemma 4 开源模型,基于 Gemini 3 技术,主打高级推理和智能体工作流。提供 E2B、E4B、26B MoE(推理时仅激活 3.8B 参数)和 31B Dense 四种尺寸,31B 在 Arena AI 文本排行榜上位列全球开源模型第 3,采用 Apache 2.0 许可,支持 128K-256K 上下文窗口、原生多模态和 140+ 语言。

    推荐理由:原文给出了四个尺寸、基准排名和部署细节,读者可以据此判断在本地和端侧硬件上的可用性。

4月2日周四
  1. Hugging Face Blog82

    Google DeepMind 发布 Gemma 4 多模态模型系列并登陆 Hugging Face

    Google DeepMind 发布 Gemma 4 多模态模型系列,共五个尺寸(E2B、E4B、12B Unified、31B、26B A4B MoE),采用 Apache 2.0 许可,支持图像、文本和音频输入,上下文窗口最高 256K。

    推荐理由:Hugging Face 官方详解 Gemma 4 架构、多模态能力与全生态部署方式,还覆盖 DiffusionGemma 和推理加速等上手细节。

3月31日周二
3月24日周二
  1. Mistral AI62

    Mistral AI 发布 Voxtral TTS 语音生成模型

    Mistral AI 发布首款文生语音模型 Voxtral TTS,4B 参数,支持 9 种语言,仅需约 3 秒参考音频即可适配自定义音色,并支持零样本跨语言音色迁移。

    推荐理由:原文给出 9 语言、3 秒参考音色、70ms 延迟等可核验细节与人类评测对比,读者可据此评估其语音智能体方案。

3月17日周二
3月7日周六
  1. Google Research50

    谷歌开源模型 SpeciesNet 如何识别野生动物相机陷阱影像

    Google 开发的开源 AI 模型 SpeciesNet 可对相机陷阱图像中约 2,500 类(2,498 类)动物进行分类,训练数据超过 6500 万张标注图像。模型在留出测试集上能找出 99.4% 含动物的图像,可识别到物种级的预测中 94.5% 正确,标准笔记本每天约可处理 3 万张图像。过去一年,全球研究团队已用它在坦桑尼亚塞伦盖蒂、哥伦比亚、澳大利亚等地分析数百万张野生动物影像。

2月5日周四
2月4日周三
1月20日周二
1月6日周二
1月5日周一
12月9日周二
  1. Mistral AI69

    Mistral 发布 Devstral 2(123B)与 Devstral Small 2(24B)编码模型及 Mistral Vibe CLI

    Mistral AI 发布开源编码模型 Devstral 2(123B)和 Devstral Small 2(24B),SWE-bench Verified 分别取得 72.2% 和 68.0%,并推出开源终端编码智能体 Mistral Vibe CLI。

    推荐理由:官方公布两个尺寸开源编码模型的基准成绩、许可与部署门槛,并同步开放终端 CLI,读者可评估其替代现有方案的成本。

12月4日周四
  1. Hugging Face Blog44

    DeepMath:基于 smolagents 的轻量级数学推理智能体

    Intel AI 软件团队推出 DeepMath,一个基于 Qwen3-4B Thinking、用 GRPO 微调并通过 smolagents 实现的数学推理智能体。模型用简短 Python 代码片段替代冗长文本推理,在沙箱中执行后回填推理上下文,输出长度最多减少 66%,同时常提升准确率。在 MATH500、AIME、HMMT、HLE 四个数据集上,GRPO 训练与智能体推理结合取得最高准确率。

12月3日周三
  1. Mistral AI82

    Mistral 发布 Mistral 3 系列模型,含 Mistral Large 3 与 Ministral 3 全系开源

    Mistral 发布 Mistral 3 系列模型,包括 41B 激活、675B 总参数的 MoE 模型 Mistral Large 3,以及 3B/8B/14B 三种尺寸的 Ministral 3 小模型,全部以 Apache 2.0 协议开源。

    推荐理由:官方发布涵盖 Large 3 与 Ministral 3 全系的参数规模、开源协议和部署途径,读者可以据此判断各档模型适合的场景。

11月19日周三