跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

188条精选相关主题产品更新论文研究开源生态

最新精选

第 141–160 条 · 共 188 条
6月27日周四
  1. Hugging Face Blog78

    Google 发布开源大语言模型 Gemma 2,Hugging Face 完成生态集成

    Google 发布开源大语言模型 Gemma 2,提供 9B 和 27B 两种参数规模,各有 base 与 instruction-tuned 版本,已上架 Hugging Face Hub。

    推荐理由:Hugging Face 官方介绍 Gemma 2 四个开放权重模型的技术细节与生态集成,并给出 transformers、TRL 微调和 Inference Endpoints 部署的可用方法。

6月12日周三
5月29日周三
5月14日周二
  1. Hugging Face Blog69

    Google 发布开源视觉语言模型 PaliGemma

    Google 发布 PaliGemma 视觉语言模型系列,采用 SigLIP-So400m 图像编码器加 Gemma-2B 文本解码器的架构,提供 pt、mix、ft 三类checkpoint,支持 224x224、448x448、896x896 三种分辨率和 bfloat16、float16、float32 三种精度。

    推荐理由:原文由官方介绍模型架构、三种checkpoint类型、基准分数和transformers推理微调用法,可作为上手PaliGemma的实用参考。

5月13日周一
  1. OpenAI News81

    OpenAI 发布新旗舰模型 GPT-4o

    OpenAI 宣布推出新旗舰模型 GPT-4o(GPT-4 Omni),该模型可实时对音频、视觉和文本进行推理。

    推荐理由:官方宣布新旗舰模型 GPT-4o,可实时跨音频、视觉和文本推理,是了解该模型定位的直接信源。

4月24日周三
4月18日周四
4月17日周三
  1. Mistral AI72

    Mistral AI 开源发布 Mixtral 8x22B 稀疏 MoE 模型

    Mistral AI 开源发布 Mixtral 8x22B,采用 Apache 2.0 许可证。该稀疏 MoE 模型总参数 141B、激活参数仅 39B,支持英语、法语、意大利语、德语和西班牙语,具备函数调用能力与 64K tokens 上下文窗口,官方称其速度快于任何稠密 70B 模型。

    推荐理由:官方给出了参数结构、许可证和基准成绩,读者可据此评估它在大模型开源阵营中的性价比和适用场景。

4月15日周一
  1. Hugging Face Blog65

    Hugging Face 发布 Idefics2:面向社区的 8B 视觉语言模型,采用 Apache 2.0 许可

    Hugging Face 发布通用多模态模型 Idefics2,参数量 8B,权重以 Apache 2.0 许可开源,支持任意图文序列输入,可回答图像问题、描述视觉内容、从文档提取信息和执行基础算术。

    推荐理由:官方发布 8B 开源多模态模型并给出基准对比和训练数据,读者可以直接在 Hub 和 transformers 中上手微调。

4月9日周二
2月28日周三
2月26日周一
  1. Mistral AI75

    Mistral 发布旗舰模型 Mistral Large 与低延迟 Mistral Small

    Mistral 发布旗舰语言模型 Mistral Large,称其在常用基准上仅次于 GPT-4,可通过 la Plateforme 和 Azure 使用,支持 32K tokens 上下文、英法德西意多语言、function calling 和 JSON 输出。同时发布优化延迟与成本的 Mistral Small,性能超过 Mixtral 8x7B,并简化了端点产品线、新增多币种定价。

    推荐理由:官方给出了 Mistral Large 的基准对比、多语言与 function calling 能力,读者可据此评估它在 API 可用模型中的位置。

2月21日周三
2月15日周四
  1. OpenAI News80

    OpenAI 发布视频生成模型 Sora,探索视频生成模型作为世界模拟器

    OpenAI 发布视频生成模型 Sora,在可变时长、分辨率和宽高比的视频与图像上联合训练文本条件扩散模型,并采用作用于时空 patch 的 Transformer 架构。Sora 可生成一分钟高保真视频,OpenAI 认为扩大视频生成模型规模是构建通用物理世界模拟器的可行路径。

    推荐理由:官方说明 Sora 的技术路线和可生成一分钟视频的能力,适合关注视频生成与世界模拟器方向的读者。

12月11日周一
  1. Mistral AI83

    Mistral AI 发布开放权重的稀疏混合专家模型 Mixtral 8x7B

    Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可的开放权重稀疏混合专家模型(SMoE),在多数基准上超过 Llama 2 70B 且推理快 6 倍,多数标准基准上匹配或超越 GPT3.5。

    推荐理由:官方给出稀疏专家架构的参数激活比例、基准对比与部署方案,为开源模型选型提供了具体的成本性能参考。

9月27日周三
  1. Mistral AI81

    Mistral AI 发布开源模型 Mistral 7B

    Mistral AI 发布 7.3B 参数开源模型 Mistral 7B,采用 Apache 2.0 许可证,在所有基准上超越 Llama 2 13B,并在多数基准上优于 Llama 1 34B。

    推荐理由:官方给出与 Llama 2 全面对比的评测数据和架构改进细节,读者可据此评估 7B 级开源模型的性价比与部署选择。