跳到正文

#模型发布

今日 0 条
10月1日周四
9月30日周三
9月29日周二
  1. Hugging Face Blog60

    NVIDIA 开源表格基础模型 Kumo Tabular,单次前向预测登顶四大基准

    NVIDIA 发布开源表格基础模型 Kumo Tabular,对带标签的表格数据在单次前向传播中完成分类或回归预测,无需训练、调参或特征工程。

    推荐理由:官方发布开放表格基础模型,用上下文学习免训练预测,作者给出了架构细节和基准表现,读者可以评估它是否适合替换现有梯度提升树流程。

  2. OpenAI News66

    OpenAI 发布 GPT-6.1 Sol,价格为 Astra 的五分之一

    OpenAI 发布 GPT-6.1 Sol,面向编码、计算机操作和专业工作,提供接近 Astra 的智能水平,标准 API 输入与输出 token 价格为 Astra 的五分之一。

    推荐理由:官方宣布 GPT-6.1 Sol 以约五分之一的价格提供接近 Astra 的能力,读者可据此评估编码与办公场景的成本取舍。

9月28日周一
  1. Hugging Face Blog67

    Hcompany 发布 Holo4 智能体系列,含 27B 与 35B-A3B 两个版本并开源全部轨迹

    Hcompany 发布 Holo4 智能体系列模型,含 27B dense 和 35B-A3B MoE 两个尺寸,并更新发布 Holotron4 Nano。模型可通过 GUI、代码、MCP 和 API 多种接口操作软件,在 OSWorld 2.0 上 Holo4 27B 得分 61.7%(Opus 5.5 为 81.8%),35B-A3B 达 30.9%,参数量和成本显著更低。

    推荐理由:原文给出 OSWorld 2.0 等基准分数、成本对比和全部轨迹开源信息,读者可以据此评估这款多接口智能体模型是否适配自己的业务工作流。

9月24日周四
9月23日周三
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词在 100 多种语言和方言中定制角色声音,可从 30 秒音频样本复刻声音,并提供 2000 多个现成声音。

    推荐理由:官方介绍了两款 TTS 模型的定制能力、基准成绩和开放渠道,开发者可以据此评估语音生成方案的选型。

9月21日周一
9月16日周三
9月9日周三
9月3日周四
9月1日周二
  1. Google Research53

    Google 发布 3.3 亿参数时间序列基础模型 TimesFM-3,支持零样本多变量预测

    Google Research 发布时间序列基础模型 TimesFM-3,参数量 3.3 亿,预训练语料超过 1 万亿时间点,原生支持零样本多变量预测。模型可同时预测多个目标序列,支持过去协变量与过去-未来协变量,通过交替注意力与 Contiguous Patch Masking 在单次前向传播中完成整段预测,每步输出第 10 到第 90 百分位共 9 个分位数。

8月27日周四
8月25日周二
8月21日周五
  1. Hugging Face Blog66

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理最高提速 3.2x

    Liquid AI 为 LFM2.5 系列三个模型(LFM2.5-1.2B-Instruct、LFM2.5-2.6B、LFM2.5-8B-A1B)发布 DSpark 草稿模型检查点,采用投机解码在不改变输出质量的前提下大幅加速解码。

    推荐理由:官方给出 DSpark 草稿模型的具体加速数据、质量等价原理和 llama.cpp 与 SGLang 的用法,端侧部署可直接迁移。

8月14日周五
8月12日周三
  1. Google DeepMind68

    Google DeepMind 发布手语转文本模型 SL2T,落地 Gboard 与 Live Transcribe

    Google DeepMind 发布多语言手语转文本(SL2T)翻译模型,首次将手语 AI 带入消费产品,支持在 Pixel 11 的 Gboard 和 Live Transcribe 中以美式手语(ASL)输入英文。

    推荐理由:原文介绍了 SL2T 的训练数据、隐私设计与基准成绩,并说明其落地产品形态,读者可以了解手语翻译模型的可行路径。

8月10日周一
8月4日周二
  1. Mistral AI58

    Mistral 发布开源多模态安全分类模型 Shieldstral,Apache 2.0 权重可自由下载

    Mistral 发布 3B 开源多模态安全分类模型 Shieldstral,以 Apache 2.0 权重开放下载。它把内容审核建模为策略自适应的问答任务,推理时用自然语言写入审核政策即可返回校准的安全分数,无需重训练,可统一处理文本、图像及提示-回复对。官方称其在文本安全、拒答检测和多模态审核上匹配或超过最大 7 倍于其体积的开源护栏模型,可在单张 16GB GPU 上运行。

7月30日周四
  1. Google DeepMind69

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型,新增视频理解与多机器人协作

    Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层具身推理大脑,可编排 VLA 模型、导航 API 等底层工具完成多步任务。

    推荐理由:官方发布详细列出了视频理解、进度追踪、多机协作的量化指标与获取入口,读者可据此评估机器人任务编排能力的变化。

7月21日周二
7月17日周五
7月15日周三
  1. Hugging Face Blog81

    Thinking Machines 发布万亿参数开源多模态模型 Inkling 及 Inkling-Small

    Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,总参数 975B、激活 41B 的 MoE 架构,原生接受图像、文本和音频输入,支持 1M 上下文窗口,训练数据为 45 万亿 token。

    推荐理由:原文给出架构细节、各档位 VRAM 部署配置和多模态评测数据,对评估落地成本和选择变体有直接参考。

7月9日周四
7月8日周三
7月2日周四
  1. Mistral AI62

    Mistral 发布 Apache-2.0 开源模型 Leanstral 1.5,6B 激活参数聚焦形式化证明

    Mistral 发布 Leanstral 1.5,Apache-2.0 许可,总参数 119B、激活 6B,主打 Lean 4 形式化证明工程。模型饱和 miniF2F,解出 587/672 PutnamBench 问题,在 FATE-H 达 87%、FATE-X 达 34%;经 mid-training、SFT 和 CISPO 强化学习三阶段训练。

    推荐理由:原文给出基准成绩、成本对比和真实代码验证案例,读者可以据此评估开源形式化推理模型的实用边界。

7月1日周三
6月30日周二
  1. Google Research63

    Google 发布表格数据零样本基础模型 TabFM

    Google Research 发布面向表格数据分类与回归的零样本基础模型 TabFM,将表格预测重构为上下文学习问题,免去人工训练、调参和特征工程。

    推荐理由:官方介绍了把表格预测重构为上下文学习问题的模型设计、合成数据训练方式和 TabArena 基准结果,读者可据此评估其对传统表格机器学习流程的影响。

6月23日周二
  1. Mistral AI68

    Mistral 发布 OCR 4,新增边界框、块分类与置信度分数,支持 170 种语言

    Mistral 发布 Mistral OCR 4,除文本外返回边界框、分类型块(标题、表格、公式、签名等)和逐页逐词置信度分数,支持 10 个语系下 170 种语言。

    推荐理由:官方公布了能力细节、定价和基准方法论,还主动列出自动评测的打分缺陷,读者可据此判断在自己场景中怎么用。

6月22日周一
6月17日周三
  1. Hugging Face Blog77

    智谱发布旗舰模型 GLM-5.2,主打 1M 上下文长时程任务

    智谱发布旗舰模型 GLM-5.2,面向长时程任务,首次在稳定的 1M-token 上下文上交付该能力,采用 MIT 开源协议。架构上提出 IndexShare,每 4 层稀疏注意力共享一个 indexer,1M 上下文下每 token FLOPs 降低 2.9 倍,并改进 MTP 层使投机解码接受长度最多提升 20%。

    推荐理由:官方技术报告给出 1M 上下文的架构改进和三项长时程基准对比,读者可以借此评估开源模型在真实编码场景的可用性。

6月11日周四
6月9日周二