跳到正文

#模型发布

今日 0 条
7月15日周三
  1. Hugging Face Blog81

    Thinking Machines 发布万亿参数开源多模态模型 Inkling 及 Inkling-Small

    Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,总参数 975B、激活 41B 的 MoE 架构,原生接受图像、文本和音频输入,支持 1M 上下文窗口,训练数据为 45 万亿 token。

    推荐理由:原文给出架构细节、各档位 VRAM 部署配置和多模态评测数据,对评估落地成本和选择变体有直接参考。

7月9日周四
7月8日周三
7月2日周四
  1. Mistral AI62

    Mistral 发布 Apache-2.0 开源模型 Leanstral 1.5,6B 激活参数聚焦形式化证明

    Mistral 发布 Leanstral 1.5,Apache-2.0 许可,总参数 119B、激活 6B,主打 Lean 4 形式化证明工程。模型饱和 miniF2F,解出 587/672 PutnamBench 问题,在 FATE-H 达 87%、FATE-X 达 34%;经 mid-training、SFT 和 CISPO 强化学习三阶段训练。

    推荐理由:原文给出基准成绩、成本对比和真实代码验证案例,读者可以据此评估开源形式化推理模型的实用边界。

7月1日周三
6月30日周二
  1. Google Research63

    Google 发布表格数据零样本基础模型 TabFM

    Google Research 发布面向表格数据分类与回归的零样本基础模型 TabFM,将表格预测重构为上下文学习问题,免去人工训练、调参和特征工程。

    推荐理由:官方介绍了把表格预测重构为上下文学习问题的模型设计、合成数据训练方式和 TabArena 基准结果,读者可据此评估其对传统表格机器学习流程的影响。

6月26日周五
6月23日周二
  1. Mistral AI68

    Mistral 发布 OCR 4,新增边界框、块分类与置信度分数,支持 170 种语言

    Mistral 发布 Mistral OCR 4,除文本外返回边界框、分类型块(标题、表格、公式、签名等)和逐页逐词置信度分数,支持 10 个语系下 170 种语言。

    推荐理由:官方公布了能力细节、定价和基准方法论,还主动列出自动评测的打分缺陷,读者可据此判断在自己场景中怎么用。

6月22日周一
6月17日周三
  1. Hugging Face Blog77

    智谱发布旗舰模型 GLM-5.2,主打 1M 上下文长时程任务

    智谱发布旗舰模型 GLM-5.2,面向长时程任务,首次在稳定的 1M-token 上下文上交付该能力,采用 MIT 开源协议。架构上提出 IndexShare,每 4 层稀疏注意力共享一个 indexer,1M 上下文下每 token FLOPs 降低 2.9 倍,并改进 MTP 层使投机解码接受长度最多提升 20%。

    推荐理由:官方技术报告给出 1M 上下文的架构改进和三项长时程基准对比,读者可以借此评估开源模型在真实编码场景的可用性。

6月11日周四
6月9日周二
6月5日周五
6月2日周二
6月1日周一
5月22日周五
5月20日周三
  1. Hugging Face Blog48

    Hugging Face 发布 OlmoEarth v1.1:更高效的对地观测模型家族

    Hugging Face 发布 OlmoEarth v1.1,新一代对地观测模型家族,计算成本最高降低 3x,同时在研究基准和合作任务上保持 v1 的性能。效率提升来自减少 token 序列长度:将 Sentinel-2 三个分辨率的 token 合并为单个 token,并通过修改预训练方法避免性能下降。新家族提供 Base、Tiny、Nano 三种规格,权重和训练代码已开放获取。

  2. Google Research70

    Google 发布 ERA 研究工具并推出 Computational Discovery,论文登上 Nature

    Google 发布基于 Gemini 的科学研究工具 ERA,可搜索文献、编写和用树搜索优化科学代码,在基因组学、公共卫生、卫星图像、神经科学、时间序列预测和数学等基准上达到专家级表现,论文发表于 Nature。

    推荐理由:原文给出 ERA 的树搜索方法、多领域基准结果和五篇应用论文细节,并说明新工具的开放入口,读者可了解它如何用于具体科学问题。

5月19日周二
  1. Hugging Face Blog66

    Hugging Face 发布 Ettin Reranker 系列:6 个 Apache 2.0 交叉编码器重排序模型

    Hugging Face 的 Tom Aarsen 发布 ettin-reranker-v1 系列,含 17M 到 1B 六个 Sentence Transformers CrossEncoder 重排序模型,基于 Ettin ModernBERT 编码器,Apache 2.0 许可,支持最长 8192 token 上下文。

    推荐理由:作者公开了六个模型、完整训练脚本和1.43亿条蒸馏数据,并给出与主流reranker的速度和精度对比,便于按规模选型或自行复现训练。

5月18日周一
5月16日周六
5月15日周五
5月7日周四
5月5日周二
4月29日周三
  1. Hugging Face Blog64

    IBM Granite 4.1 系列模型发布并详解训练过程

    IBM Granite 团队发布 Granite 4.1 系列 dense 模型,含 3B、8B、30B 三个规模,在约 15T tokens 上训练,上下文经长文本扩展达 512K,均以 Apache 2.0 许可开源。

    推荐理由:原文完整披露了五阶段预训练、SFT 质控和四阶段 RL 的训练配方,8B 稠密模型对标上一代 32B-A9B MoE 的结果也可供选型参考。

4月28日周二
  1. Hugging Face Blog66

    NVIDIA 发布 Nemotron 3 Nano Omni 全模态模型,覆盖文档、语音、视频与 GUI 智能体

    NVIDIA 发布 Nemotron 3 Nano Omni(30B-A3B)全模态理解模型,支持文档分析、ASR、长音视频理解和 agentic computer use,并在 Hugging Face 开放 BF16、FP8 和 NVFP4 权重。

    推荐理由:原文给出完整基准对比和架构细节,读者可以据此评估它是否值得替换现有的多模态工作流。

4月24日周五
  1. Hugging Face Blog83

    DeepSeek 发布 V4:MoE 双检查点上线 Hub,主打百万 token 上下文的 Agent 能力

    DeepSeek 发布 V4,在 Hub 上开源 DeepSeek-V4-Pro(1.6T 总参数 / 49B 激活)和 DeepSeek-V4-Flash(284B 总参数 / 13B 激活)两个 instruct 及对应 base 检查点,均支持 1M token 上下文。

    推荐理由:文章拆解了 V4 为长上下文与 Agent 场景做的架构与后训练设计,读者可据此评估开源模型跑长任务的部署成本。

4月23日周四
  1. OpenAI News51

    OpenAI 发布 GPT-5.5 System Card

    OpenAI 发布了 GPT-5.5 的 System Card(系统卡)。本次抓取仅获取到标题,正文内容缺失,具体模型能力与安全评估信息以原文链接为准:https://openai.com/index/gpt-5-5-system-card

4月22日周三
4月16日周四
4月13日周一
4月9日周四
  1. Hugging Face Blog65

    Overworld 发布实时视频世界模型 Waypoint-1.5,消费级 GPU 可本地运行

    Overworld 发布实时视频世界模型 Waypoint-1.5,权重已上传 Hugging Face。在 RTX 3090 至 5090 桌面硬件上可实时生成最高 720p、60 FPS 的交互环境,另提供面向游戏笔记本等更广消费级硬件的 360p 档位,Apple Silicon 支持即将推出。

    推荐理由:原文给出两档模型的具体硬件门槛、帧率分辨率和约百倍数据训练规模,读者可据此判断自己的设备能否本地运行。

4月3日周五
  1. Google DeepMind79

    Google DeepMind 发布 Gemma 4 开源模型,E2B/E4B/26B MoE/31B 四尺寸

    Google DeepMind 发布 Gemma 4 开源模型,基于 Gemini 3 技术,主打高级推理和智能体工作流。提供 E2B、E4B、26B MoE(推理时仅激活 3.8B 参数)和 31B Dense 四种尺寸,31B 在 Arena AI 文本排行榜上位列全球开源模型第 3,采用 Apache 2.0 许可,支持 128K-256K 上下文窗口、原生多模态和 140+ 语言。

    推荐理由:原文给出了四个尺寸、基准排名和部署细节,读者可以据此判断在本地和端侧硬件上的可用性。

4月2日周四
  1. Hugging Face Blog82

    Google DeepMind 发布 Gemma 4 多模态模型系列并登陆 Hugging Face

    Google DeepMind 发布 Gemma 4 多模态模型系列,共五个尺寸(E2B、E4B、12B Unified、31B、26B A4B MoE),采用 Apache 2.0 许可,支持图像、文本和音频输入,上下文窗口最高 256K。

    推荐理由:Hugging Face 官方详解 Gemma 4 架构、多模态能力与全生态部署方式,还覆盖 DiffusionGemma 和推理加速等上手细节。