OpenAI 发布 CriticGPT,用 GPT-4 找出 GPT-4 的错误
OpenAI 发布基于 GPT-4 的模型 CriticGPT,它能对 ChatGPT 的回复撰写批评意见,帮助人类训练员在 RLHF 过程中发现错误。
推荐理由:基于 GPT-4 的 CriticGPT 为 ChatGPT 回复写批评意见,帮助人类训练员在 RLHF 中发现错误。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
OpenAI 发布基于 GPT-4 的模型 CriticGPT,它能对 ChatGPT 的回复撰写批评意见,帮助人类训练员在 RLHF 过程中发现错误。
推荐理由:基于 GPT-4 的 CriticGPT 为 ChatGPT 回复写批评意见,帮助人类训练员在 RLHF 中发现错误。
Google 发布开源大语言模型 Gemma 2,提供 9B 和 27B 两种参数规模,各有 base 与 instruction-tuned 版本,已上架 Hugging Face Hub。
推荐理由:Hugging Face 官方介绍 Gemma 2 四个开放权重模型的技术细节与生态集成,并给出 transformers、TRL 微调和 Inference Endpoints 部署的可用方法。
Stable Diffusion 3 Medium(2B 参数)现已在 Hugging Face Hub 开放,可通过 🧨 Diffusers 使用,并附 DreamBooth 与 LoRA 训练脚本。
推荐理由:Hugging Face 官方讲解了 SD3 的 MMDiT 架构与 Diffusers 用法,附内存与性能优化数据,可直接迁移到自己的推理和微调流程。
Mistral AI 发布首个代码生成模型 Codestral,为 22B 开源权重模型,训练数据覆盖 80+ 编程语言,支持 32k 上下文窗口和 fill-in-the-middle 机制。
推荐理由:官方原文给出 22B 参数、32k 上下文、80+ 语言和多个基准对比,读者可以据此评估它在代码补全场景中的位置。
Google 发布 PaliGemma 视觉语言模型系列,采用 SigLIP-So400m 图像编码器加 Gemma-2B 文本解码器的架构,提供 pt、mix、ft 三类checkpoint,支持 224x224、448x448、896x896 三种分辨率和 bfloat16、float16、float32 三种精度。
推荐理由:原文由官方介绍模型架构、三种checkpoint类型、基准分数和transformers推理微调用法,可作为上手PaliGemma的实用参考。
OpenAI 宣布推出新旗舰模型 GPT-4o(GPT-4 Omni),该模型可实时对音频、视觉和文本进行推理。
推荐理由:官方宣布新旗舰模型 GPT-4o,可实时跨音频、视觉和文本推理,是了解该模型定位的直接信源。
OpenAI 发布 GPT-4o,并在 ChatGPT 中向免费用户开放更多能力。
推荐理由:OpenAI 官方宣布 GPT-4o,并提及免费用户可用性变化,适合想了解该模型基本定位的读者。
OpenAI 宣布推出最新旗舰模型 GPT-4o,并在 ChatGPT 中向免费用户开放更多能力。发布同时带来更多工具供免费用户使用。
推荐理由:OpenAI 官宣新旗舰模型,并说明同步向免费用户开放更多 ChatGPT 能力,适合关注模型可用范围变化。
OpenAI 宣布 GPT-4 API 全面可用,GPT-3.5 Turbo、DALL·E 和 Whisper API 也已全面开放。同时发布 Completions API 旧模型的退役计划,这些旧模型将于 2024 年初退役。
推荐理由:官方宣布 GPT-4 等 API 全面开放并给出旧模型退役计划,开发者可据此调整接入与迁移安排。
Meta 发布 Llama 3 开源模型,提供 8B 和 70B 两种规模,各有 base 与 instruct 版本,并附基于 Llama 3 8B 微调的 Llama Guard 2,全部上架 Hugging Face Hub。
推荐理由:官方发布说明完整给出模型规格、许可证变化和部署微调路径,读者可据此评估升级与迁移成本。
Mistral AI 开源发布 Mixtral 8x22B,采用 Apache 2.0 许可证。该稀疏 MoE 模型总参数 141B、激活参数仅 39B,支持英语、法语、意大利语、德语和西班牙语,具备函数调用能力与 64K tokens 上下文窗口,官方称其速度快于任何稠密 70B 模型。
推荐理由:官方给出了参数结构、许可证和基准成绩,读者可据此评估它在大模型开源阵营中的性价比和适用场景。
Hugging Face 发布通用多模态模型 Idefics2,参数量 8B,权重以 Apache 2.0 许可开源,支持任意图文序列输入,可回答图像问题、描述视觉内容、从文档提取信息和执行基础算术。
推荐理由:官方发布 8B 开源多模态模型并给出基准对比和训练数据,读者可以直接在 Hub 和 transformers 中上手微调。
Google 与 Hugging Face 合作发布 CodeGemma,包含专注代码填充的 2B 基座、混合代码与自然语言的 7B 基座,以及 7B Instruct 对话版本,均支持 8K 上下文。
推荐理由:原文给出三个模型规格、基准对比与 FIM 提示词格式,读者可以据此选择适合延迟、显存或对话场景的版本。
BigCode 发布 StarCoder2 系列开放代码模型,含 3B、7B、15B 三个规模,均基于新数据集 The Stack v2 训练,并同步开放模型、数据集及处理与训练代码。
推荐理由:官方完整披露三个模型规模、训练数据与开放范围,读者可据此评估开源代码模型的可复用程度。
Mistral 发布旗舰语言模型 Mistral Large,称其在常用基准上仅次于 GPT-4,可通过 la Plateforme 和 Azure 使用,支持 32K tokens 上下文、英法德西意多语言、function calling 和 JSON 输出。同时发布优化延迟与成本的 Mistral Small,性能超过 Mixtral 8x7B,并简化了端点产品线、新增多币种定价。
推荐理由:官方给出了 Mistral Large 的基准对比、多语言与 function calling 能力,读者可据此评估它在 API 可用模型中的位置。
Google 发布开源大语言模型家族 Gemma,包含 2B 与 7B 两种规模、各有 base 与 instruction-tuned 共四个模型,基于 Gemini 技术并支持 8K 上下文。
推荐理由:官方博客给出四个开源模型的尺寸、性能对比和 Hugging Face 生态集成方式,读者可据此评估部署与微调路径。
OpenAI 发布视频生成模型 Sora,在可变时长、分辨率和宽高比的视频与图像上联合训练文本条件扩散模型,并采用作用于时空 patch 的 Transformer 架构。Sora 可生成一分钟高保真视频,OpenAI 认为扩大视频生成模型规模是构建通用物理世界模拟器的可行路径。
推荐理由:官方说明 Sora 的技术路线和可生成一分钟视频的能力,适合关注视频生成与世界模拟器方向的读者。
Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可的开放权重稀疏混合专家模型(SMoE),在多数基准上超过 Llama 2 70B 且推理快 6 倍,多数标准基准上匹配或超越 GPT3.5。
推荐理由:官方给出稀疏专家架构的参数激活比例、基准对比与部署方案,为开源模型选型提供了具体的成本性能参考。
Mistral 发布 Mixtral 8x7B,一个采用 Mixture of Experts 架构的开放模型,在多数基准上超越 Llama 2 70B 并达到或超过 GPT-3.5,MT-Bench 得分 8.30。
推荐理由:Mixtral 8x7B 以 MoE 架构达到开放模型新高度,本文同时给出生态内的推理、量化、微调与部署路径,方法可直接照做。
Mistral AI 发布 7.3B 参数开源模型 Mistral 7B,采用 Apache 2.0 许可证,在所有基准上超越 Llama 2 13B,并在多数基准上优于 Llama 1 34B。
推荐理由:官方给出与 Llama 2 全面对比的评测数据和架构改进细节,读者可据此评估 7B 级开源模型的性价比与部署选择。