跳到正文

#模型发布

今日 0 条
5月21日周三
  1. Mistral AI70

    Mistral AI 与 All Hands AI 联合发布开源编码模型 Devstral

    Mistral AI 与 All Hands AI 联合发布面向软件工程任务的智能体模型 Devstral,以 Apache 2.0 许可开源,在 SWE-Bench Verified 上取得 46.8%,超过此前开源 SoTA 6 个百分点以上,并超越 GPT-4.1-mini 超过 20%。

    推荐理由:原文给出 SWE-Bench Verified 具体分数和部署门槛,可判断这款开源编码模型在本地与隐私场景的可行性。

5月16日周五
  1. OpenAI News65

    OpenAI 发布云端编码智能体 Codex,由 codex-1 驱动

    OpenAI 在 o3 和 o4-mini 系统卡附录中介绍云端编码智能体 Codex,底层为针对软件工程优化的 o3 版本 codex-1。该模型通过强化学习在多种环境的真实编码任务上训练,生成贴近人类风格和 PR 偏好的代码,精确遵循指令,并迭代运行测试直至通过。

    推荐理由:原文说明了 codex-1 的训练方式与目标能力,读者可以了解 Codex 与一般代码补全的区别。

5月15日周四
5月7日周三
4月30日周三
4月23日周三
4月16日周三
  1. OpenAI News83

    OpenAI 发布 o3 与 o4-mini 模型

    OpenAI 发布 o3 和 o4-mini 两款新模型,称其为迄今最智能、能力最强的模型,并支持完整的工具调用。

    推荐理由:官方宣布 o3 与 o4-mini 两款新模型,主打更强能力与完整工具调用,想了解 OpenAI 推理模型最新进展可由此入手。

  2. OpenAI News77

    OpenAI 发布 o3 与 o4-mini 系统卡

    OpenAI 发布 o3 与 o4-mini 系统卡,两款模型结合了先进推理能力与完整工具能力。工具能力涵盖网页浏览、Python、图像与文件分析、图像生成、canvas、automations、文件搜索和 memory。

    推荐理由:官方说明 o3 与 o4-mini 同时具备推理和完整工具调用能力,读者可据此了解这两个新模型的能力范围。

4月14日周一
4月11日周五
4月5日周六
  1. Hugging Face Blog80

    Meta 发布 Llama 4 Maverick 与 Scout,Hugging Face 同步上线权重与生态支持

    Meta 发布 Llama 4 Maverick(约 400B、128 专家)和 Scout(约 109B、16 专家),均为 17B 激活参数的 MoE 原生多模态模型,在最多 40 万亿 token、200 种语言数据上训练。

    推荐理由:官方公告给出两款模型的参数、上下文长度与架构细节,读者可以据此评估部署门槛和与 transformers 的集成方式。

3月27日周四
  1. Hugging Face Blog74

    DeepSeek-V3-0324 上架 Hugging Face Hub,Hugging Face 团队详解性能与使用方式

    DeepSeek-V3 更新版 0324 上架 Hugging Face Hub,架构与原版相同并改为 MIT 许可,重点改进指令遵循、代码与数学能力。官方基准显示 MMLU-Pro 75.9→81.2、AIME 39.6→59.4、LiveCodeBench 39.2→49.2,常与 GPT-4.5 相当、普遍强于 Claude-Sonnet-3.7。

    推荐理由:原文汇总了基准对比、能力改进细节和多种本地部署路径,读者可据此评估是否在自己的工作流中替换旧版 V3。

3月25日周二
  1. OpenAI News78

    OpenAI 发表 GPT-4o 图像生成系统卡附录

    OpenAI 发表 GPT-4o 系统卡附录,介绍 4o 图像生成,称其比此前 DALL·E 3 系列能力显著更强。它能生成照片级真实输出,并支持以图像作为输入进行转换。

    推荐理由:原文明确了 4o 图像生成相比 DALL·E 3 的能力跃升,读者可以据此判断它在生成与图像转换上的新定位。

3月18日周二
  1. Hugging Face Blog66

    NVIDIA GTC 2025 发布 Cosmos Transfer、Physical AI Dataset 与人形机器人基础模型 Isaac GR00T N1

    NVIDIA 在 GTC 2025 上发布三项面向物理 AI 的开源资源:70 亿参数的 Cosmos Transfer 世界基础模型、含超过 32 万条轨迹共 15 TB 数据的 Physical AI Dataset,以及首个开放的人形机器人推理与技能基础模型 NVIDIA Isaac GR00T N1。

    推荐理由:官方一次放出 Cosmos Transfer、开放数据集和 GR00T N1 三项资源,开发者可直接获取模型权重与数据用于机器人和自动驾驶研发。

3月17日周一
3月12日周三
  1. Hugging Face Blog63

    Hugging Face Open R1 更新:发布 CodeForces-CoTs 数据集、IOI 基准与 OlympicCoder 7B/32B 模型

    Hugging Face 在 Open R1 第三次更新中发布了从 DeepSeek-R1 蒸馏的 CodeForces-CoTs 数据集(近 10 万样本)、2024 年 IOI 题目构成的 IOI 基准,以及基于 Qwen2.5 Coder 微调的 OlympicCoder-7B 和 OlympicCoder-32B。

    推荐理由:Hugging Face 官方复盘训练过程,给出样本打包、学习率等可复用经验,并附带完整数据集、基准和评测代码。

3月7日周五
3月4日周二
2月27日周四
  1. OpenAI News64

    OpenAI 发布 GPT-4.5 研究预览版

    OpenAI 发布 GPT-4.5 的研究预览版,称其为目前最大、知识最丰富的模型。材料仅含发布说明摘要,未提供更多技术细节。

    推荐理由:OpenAI 官方确认 GPT-4.5 以研究预览版发布,并定位为其最大、知识最丰富的模型。

2月21日周五
  1. Hugging Face Blog55

    Google 发布多语言视觉语言编码器家族 SigLIP 2

    Google 发布 SigLIP 2 多语言视觉语言编码器家族,在 sigmoid 损失之上加入解码器、Global-Local 损失和 Masked Prediction 等训练目标。新模型在零样本分类、图文检索和为 VLM 提取视觉表征的迁移能力上全面超过旧版 SigLIP,并新增动态分辨率的 naflex 变体和 1B 参数的 Giant 系列,模型已在 Hugging Face 开放。

2月20日周四
2月19日周三
2月17日周一
  1. Mistral AI55

    Mistral 发布 24B 区域语言模型 Mistral Saba,主打中东和南亚语言

    Mistral AI 发布 24B 参数区域语言模型 Mistral Saba,基于中东和南亚数据训练,官方称其表现优于 5 倍以上规模的模型且更快更省成本。模型支持阿拉伯语及多种印度语系语言(泰米尔语尤其强),可通过 API 使用,也可像 Mistral Small 3 一样在单 GPU 上本地部署,速度超过 150 tokens per second。

1月31日周五
1月30日周四
  1. Mistral AI66

    Mistral 发布 Mistral Small 3:24B 参数开源模型,性能对标 Llama 3.3 70B

    Mistral 发布 Mistral Small 3,一个延迟优化的 24B 参数模型,以 Apache 2.0 许可开源预训练和指令微调权重。模型 MMLU 准确率超 81%,延迟 150 tokens/s,官方称性能与 Llama 3.3 70B instruct 相当且在相同硬件上快 3 倍以上。

    推荐理由:24B 参数、Apache 2.0 开源、可在单卡 RTX 4090 本地运行,读者可据此评估低延迟场景下的替代方案。

1月23日周四
1月13日周一
1月10日周五
12月19日周四
12月18日周三
12月17日周二
12月9日周一
  1. OpenAI News80

    OpenAI 发布视频生成模型 Sora,已上线 sora.com

    OpenAI 宣布视频生成模型 Sora 上线,用户可在 sora.com 使用。支持生成最高 1080p、最长 20 秒的视频,可选宽屏、竖屏或方形比例,还可导入自有素材进行扩展、混剪与融合,或从文本生成全新内容。

    推荐理由:官方公布视频生成的分辨率、时长与素材混用方式,读者可据此判断是否把 Sora 纳入现有视频创作流程。

  2. OpenAI News67

    OpenAI 发布 Sora 视频生成模型系统卡

    OpenAI 发布 Sora 视频生成模型的系统卡。Sora 接受文本、图像和视频输入并生成新视频,建立在 DALL-E 和 GPT 模型的经验之上,旨在为人们的叙事和创意表达提供更多工具。

    推荐理由:官方系统卡说明了 Sora 的输入输出形式和模型来源,读者可以据此了解其能力定位。

12月5日周四
  1. Hugging Face Blog62

    Google 发布视觉语言模型 PaliGemma 2,含 3B、10B、28B 三种规模

    Google 发布视觉语言模型 PaliGemma 2,将 SigLIP 图像编码器与 Gemma 2 语言模型结合,提供 3B、10B、28B 三种规模,支持 224x224、448x448 和 896x896 三种输入分辨率。

    推荐理由:Google 发布 PaliGemma 2 视觉语言模型,提供 3B、10B、28B 三种规模与多分辨率选择,并附 transformers 集成和微调脚本。

11月26日周二
11月18日周一
  1. Mistral AI66

    Mistral 发布 124B 开源权重多模态模型 Pixtral Large

    Mistral 发布 Pixtral Large,一个基于 Mistral Large 2 的 124B 开源权重多模态模型,在 MathVista 达到 69.4%,DocVQA 与 ChartQA 上超过 GPT-4o 和 Gemini-1.5 Pro,LMSys Vision Leaderboard 上领先最近的开放权重模型近 50 ELO。

    推荐理由:官方给出关键基准数字和开放下载渠道,读者可以据此判断该多模态模型在图像理解和文本能力上的定位。