跳到正文

#模型发布

今日 2 条
5月13日周一
4月29日周一
4月24日周三
4月18日周四
4月17日周三
  1. Mistral AI72

    Mistral AI 开源发布 Mixtral 8x22B 稀疏 MoE 模型

    Mistral AI 开源发布 Mixtral 8x22B,采用 Apache 2.0 许可证。该稀疏 MoE 模型总参数 141B、激活参数仅 39B,支持英语、法语、意大利语、德语和西班牙语,具备函数调用能力与 64K tokens 上下文窗口,官方称其速度快于任何稠密 70B 模型。

    推荐理由:官方给出了参数结构、许可证和基准成绩,读者可据此评估它在大模型开源阵营中的性价比和适用场景。

4月15日周一
  1. Hugging Face Blog65

    Hugging Face 发布 Idefics2:面向社区的 8B 视觉语言模型,采用 Apache 2.0 许可

    Hugging Face 发布通用多模态模型 Idefics2,参数量 8B,权重以 Apache 2.0 许可开源,支持任意图文序列输入,可回答图像问题、描述视觉内容、从文档提取信息和执行基础算术。

    推荐理由:官方发布 8B 开源多模态模型并给出基准对比和训练数据,读者可以直接在 Hub 和 transformers 中上手微调。

4月9日周二
2月28日周三
2月26日周一
  1. Mistral AI75

    Mistral 发布旗舰模型 Mistral Large 与低延迟 Mistral Small

    Mistral 发布旗舰语言模型 Mistral Large,称其在常用基准上仅次于 GPT-4,可通过 la Plateforme 和 Azure 使用,支持 32K tokens 上下文、英法德西意多语言、function calling 和 JSON 输出。同时发布优化延迟与成本的 Mistral Small,性能超过 Mixtral 8x7B,并简化了端点产品线、新增多币种定价。

    推荐理由:官方给出了 Mistral Large 的基准对比、多语言与 function calling 能力,读者可据此评估它在 API 可用模型中的位置。

2月21日周三
2月15日周四
  1. OpenAI News80

    OpenAI 发布视频生成模型 Sora,探索视频生成模型作为世界模拟器

    OpenAI 发布视频生成模型 Sora,在可变时长、分辨率和宽高比的视频与图像上联合训练文本条件扩散模型,并采用作用于时空 patch 的 Transformer 架构。Sora 可生成一分钟高保真视频,OpenAI 认为扩大视频生成模型规模是构建通用物理世界模拟器的可行路径。

    推荐理由:官方说明 Sora 的技术路线和可生成一分钟视频的能力,适合关注视频生成与世界模拟器方向的读者。

1月4日周四
12月11日周一
  1. Mistral AI83

    Mistral AI 发布开放权重的稀疏混合专家模型 Mixtral 8x7B

    Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可的开放权重稀疏混合专家模型(SMoE),在多数基准上超过 Llama 2 70B 且推理快 6 倍,多数标准基准上匹配或超越 GPT3.5。

    推荐理由:官方给出稀疏专家架构的参数激活比例、基准对比与部署方案,为开源模型选型提供了具体的成本性能参考。

9月27日周三
  1. Mistral AI81

    Mistral AI 发布开源模型 Mistral 7B

    Mistral AI 发布 7.3B 参数开源模型 Mistral 7B,采用 Apache 2.0 许可证,在所有基准上超越 Llama 2 13B,并在多数基准上优于 Llama 1 34B。

    推荐理由:官方给出与 Llama 2 全面对比的评测数据和架构改进细节,读者可据此评估 7B 级开源模型的性价比与部署选择。

  2. Mistral AI84

    Mistral AI 发布首个 7B 参数开源模型 Mistral 7B,采用 Apache 2.0 许可

    Mistral AI 发布首个模型 Mistral 7B,在标准英文和代码基准上超越所有现有 13B 参数以下的开放模型,权重以 Apache 2.0 许可开放。官方称 MMLU 上超过 60% 的最小模型在两年内从 280B 的 Gopher 缩小到 7B,并同步开设 GitHub 仓库和 Discord 频道推进社区协作。

    推荐理由:官方阐述开源模型路线并给出 MMLU 演进脉络,读者可借此理解 7B 小模型与专有模型的差距变化。

9月25日周一
9月13日周三
  1. Hugging Face Blog65

    Hugging Face 发布 Würstchen 快速文生图扩散模型

    Hugging Face 发布 Würstchen,一种在高度压缩潜空间中工作的文生图扩散模型,实现 42x 空间压缩。生成速度明显快于 SDXL 且内存占用更低;Würstchen v2 训练用 24,602 GPU 小时,支持最高 1536 分辨率,已集成进 Diffusers,模型权重和 Demo 已在 Hub 上线。

    推荐理由:42x 空间压缩带来的训练与推理成本对比有具体数字,适合想低成本跑文生图的读者参考。

9月8日周五
  1. Hugging Face Blog61

    T2I-Adapter-SDXL 适配器发布并登陆 diffusers

    Hugging Face Diffusers 团队与 T2I-Adapter 作者合作,为 Stable Diffusion XL 推出 T2I-Adapter 支持,并发布 sketch、canny、lineart、depth、openpose 五种条件的 checkpoints。

    推荐理由:原文给出 T2I-Adapter-SDXL 与 ControlNet 的参数量对比、训练配置和完整用法代码,读者可以据此评估并直接上手使用。

9月6日周三
8月25日周五
  1. Hugging Face Blog83

    Code Llama 发布:Llama 2 代码特化系列模型接入 Hugging Face 生态

    Hugging Face 发布 Code Llama 系列开源代码模型集成,含 7B、13B、34B 三种规格,基于 Llama 2 在 500B token 代码数据上训练,提供 Python 特化版和指令微调版。

    推荐理由:官方完整介绍了模型规格、上下文扩展原理和生态接入方式,读者可以直接据此选择规格并上手部署使用。

8月22日周二
  1. Hugging Face Blog71

    Hugging Face 发布开源视觉语言模型 IDEFICS,复现 Flamingo

    Hugging Face 发布开源视觉语言模型 IDEFICS,是 DeepMind 未公开的 Flamingo 的开放复现,接受任意图像和文本序列输入并生成文本,在多个图像文本理解基准上与原闭源模型表现相当。

    推荐理由:原文说明了 IDEFICS 基于 Flamingo 的复现路线、参数规模与完全公开数据的训练方式,适合关注开源多模态模型生态的读者。

8月1日周二
7月18日周二
6月5日周一
5月15日周一
  1. Hugging Face Blog64

    RWKV 架构接入 Hugging Face transformers 库:兼具 RNN 与 transformer 优势

    RWKV 是一种结合 RNN 与 transformer 优势的新架构,已通过 PR 正式集成到 Hugging Face transformers 库。该架构训练时可并行(类似线性化 GPT),推理时仅需矩阵向量运算、内存不随上下文增长;已有训练上下文长度 8192 的模型与 ctx1024 模型速度和内存相当。

    推荐理由:RWKV 结合 RNN 与 transformer 两种架构的优势,官方介绍了其原理、可用模型规模及在 transformers 库中的实际用法。

5月4日周四
3月14日周二
  1. OpenAI News94

    OpenAI 发布多模态大模型 GPT-4

    OpenAI 发布 GPT-4,称其为扩大深度学习规模的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入、输出文本;虽然许多真实场景下仍不及人类,但在多项专业和学术基准上表现出人类水平性能。

    推荐理由:官方原文明确 GPT-4 接受图像和文本输入,并在多项专业与学术基准上达到人类水平表现,可据此了解其能力定位。

  2. OpenAI News92

    OpenAI 发布 GPT-4

    OpenAI 发布 GPT-4。该模型可在创意和技术写作任务上生成、编辑并与用户迭代,例如创作歌曲、撰写剧本或学习用户的写作风格。

    推荐理由:官方宣布 GPT-4 发布,说明其在创意与技术写作任务上的生成、编辑和迭代能力,可作为了解该模型基础能力的入口。

3月6日周一
2月8日周三
12月15日周四
11月30日周三
  1. OpenAI News89

    OpenAI 发布对话式模型 ChatGPT

    OpenAI 训练了名为 ChatGPT 的对话式交互模型。对话格式使其能回答追问、承认错误、挑战错误前提,并拒绝不当请求。

    推荐理由:这是 ChatGPT 的原始发布说明,对话格式带来的追问与纠错能力至今仍是理解其产品形态的起点。

10月5日周三
9月21日周三
7月12日周二
  1. Hugging Face Blog74

    Hugging Face 发布 176B 参数开源多语言大模型 BLOOM

    BigScience 项目发布开源多语言大模型 BLOOM,1760 亿参数,可生成 46 种自然语言和 13 种编程语言的文本。训练历时 117 天,在法国 Jean Zay 超算上完成,涉及 70 多国 250 多个机构的 1000 多名研究者。

    推荐理由:大语言模型开源和透明训练的代表性案例,说明了开放协作如何让百亿级参数模型走向可研究、可复用。

3月15日周二
1月27日周四
  1. OpenAI News77

    OpenAI 发布 InstructGPT 并设为 API 默认语言模型

    OpenAI 训练出比 GPT-3 更能遵循用户意图、同时更真实且毒性更低的 InstructGPT 模型,采用其对齐研究开发、有人类参与闭环的训练技术。这些模型现已部署为 OpenAI API 的默认语言模型。

    推荐理由:OpenAI 官方说明 InstructGPT 的对齐训练思路及其成为 API 默认模型的变化,可帮读者理解当时模型行为取向的调整。

12月16日周四