OpenAI 发布 GPT-4o 并向 ChatGPT 免费用户开放更多工具
OpenAI 宣布推出最新旗舰模型 GPT-4o,并在 ChatGPT 中向免费用户开放更多能力。发布同时带来更多工具供免费用户使用。
推荐理由:OpenAI 官宣新旗舰模型,并说明同步向免费用户开放更多 ChatGPT 能力,适合关注模型可用范围变化。
OpenAI 宣布推出最新旗舰模型 GPT-4o,并在 ChatGPT 中向免费用户开放更多能力。发布同时带来更多工具供免费用户使用。
推荐理由:OpenAI 官宣新旗舰模型,并说明同步向免费用户开放更多 ChatGPT 能力,适合关注模型可用范围变化。
Hugging Face 团队发布 StarCoder2-15B-Instruct-v0.1,首个采用完全透明、许可开放管线的自对齐代码 LLM,无需人工标注或从专有大模型蒸馏数据。
OpenAI 宣布 GPT-4 API 全面可用,GPT-3.5 Turbo、DALL·E 和 Whisper API 也已全面开放。同时发布 Completions API 旧模型的退役计划,这些旧模型将于 2024 年初退役。
推荐理由:官方宣布 GPT-4 等 API 全面开放并给出旧模型退役计划,开发者可据此调整接入与迁移安排。
Meta 发布 Llama 3 开源模型,提供 8B 和 70B 两种规模,各有 base 与 instruct 版本,并附基于 Llama 3 8B 微调的 Llama Guard 2,全部上架 Hugging Face Hub。
推荐理由:官方发布说明完整给出模型规格、许可证变化和部署微调路径,读者可据此评估升级与迁移成本。
Mistral AI 开源发布 Mixtral 8x22B,采用 Apache 2.0 许可证。该稀疏 MoE 模型总参数 141B、激活参数仅 39B,支持英语、法语、意大利语、德语和西班牙语,具备函数调用能力与 64K tokens 上下文窗口,官方称其速度快于任何稠密 70B 模型。
推荐理由:官方给出了参数结构、许可证和基准成绩,读者可据此评估它在大模型开源阵营中的性价比和适用场景。
Hugging Face 发布通用多模态模型 Idefics2,参数量 8B,权重以 Apache 2.0 许可开源,支持任意图文序列输入,可回答图像问题、描述视觉内容、从文档提取信息和执行基础算术。
推荐理由:官方发布 8B 开源多模态模型并给出基准对比和训练数据,读者可以直接在 Hub 和 transformers 中上手微调。
Google 与 Hugging Face 合作发布 CodeGemma,包含专注代码填充的 2B 基座、混合代码与自然语言的 7B 基座,以及 7B Instruct 对话版本,均支持 8K 上下文。
推荐理由:原文给出三个模型规格、基准对比与 FIM 提示词格式,读者可以据此选择适合延迟、显存或对话场景的版本。
BigCode 发布 StarCoder2 系列开放代码模型,含 3B、7B、15B 三个规模,均基于新数据集 The Stack v2 训练,并同步开放模型、数据集及处理与训练代码。
推荐理由:官方完整披露三个模型规模、训练数据与开放范围,读者可据此评估开源代码模型的可复用程度。
Mistral 发布旗舰语言模型 Mistral Large,称其在常用基准上仅次于 GPT-4,可通过 la Plateforme 和 Azure 使用,支持 32K tokens 上下文、英法德西意多语言、function calling 和 JSON 输出。同时发布优化延迟与成本的 Mistral Small,性能超过 Mixtral 8x7B,并简化了端点产品线、新增多币种定价。
推荐理由:官方给出了 Mistral Large 的基准对比、多语言与 function calling 能力,读者可据此评估它在 API 可用模型中的位置。
Google 发布开源大语言模型家族 Gemma,包含 2B 与 7B 两种规模、各有 base 与 instruction-tuned 共四个模型,基于 Gemini 技术并支持 8K 上下文。
推荐理由:官方博客给出四个开源模型的尺寸、性能对比和 Hugging Face 生态集成方式,读者可据此评估部署与微调路径。
OpenAI 发布视频生成模型 Sora,在可变时长、分辨率和宽高比的视频与图像上联合训练文本条件扩散模型,并采用作用于时空 patch 的 Transformer 架构。Sora 可生成一分钟高保真视频,OpenAI 认为扩大视频生成模型规模是构建通用物理世界模拟器的可行路径。
推荐理由:官方说明 Sora 的技术路线和可生成一分钟视频的能力,适合关注视频生成与世界模拟器方向的读者。
Hugging Face 发布 MUSE 的开源复现 aMUSEd,一个基于 Masked Image Modeling 的非扩散文生图模型,以研究预览形式采用 OpenRAIL 许可发布。
Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可的开放权重稀疏混合专家模型(SMoE),在多数基准上超过 Llama 2 70B 且推理快 6 倍,多数标准基准上匹配或超越 GPT3.5。
推荐理由:官方给出稀疏专家架构的参数激活比例、基准对比与部署方案,为开源模型选型提供了具体的成本性能参考。
Mistral 发布 Mixtral 8x7B,一个采用 Mixture of Experts 架构的开放模型,在多数基准上超越 Llama 2 70B 并达到或超过 GPT-3.5,MT-Bench 得分 8.30。
推荐理由:Mixtral 8x7B 以 MoE 架构达到开放模型新高度,本文同时给出生态内的推理、量化、微调与部署路径,方法可直接照做。
Mistral AI 发布 7.3B 参数开源模型 Mistral 7B,采用 Apache 2.0 许可证,在所有基准上超越 Llama 2 13B,并在多数基准上优于 Llama 1 34B。
推荐理由:官方给出与 Llama 2 全面对比的评测数据和架构改进细节,读者可据此评估 7B 级开源模型的性价比与部署选择。
Mistral AI 发布首个模型 Mistral 7B,在标准英文和代码基准上超越所有现有 13B 参数以下的开放模型,权重以 Apache 2.0 许可开放。官方称 MMLU 上超过 60% 的最小模型在两年内从 280B 的 Gopher 缩小到 7B,并同步开设 GitHub 仓库和 Discord 频道推进社区协作。
推荐理由:官方阐述开源模型路线并给出 MMLU 演进脉络,读者可借此理解 7B 小模型与专有模型的差距变化。
OpenAI 发布 GPT-4V(ision) 系统卡,说明其图像输入能力及相关评估情况。抓取内容仅含标题,正文细节不可得。
Hugging Face 发布 Würstchen,一种在高度压缩潜空间中工作的文生图扩散模型,实现 42x 空间压缩。生成速度明显快于 SDXL 且内存占用更低;Würstchen v2 训练用 24,602 GPU 小时,支持最高 1536 分辨率,已集成进 Diffusers,模型权重和 Demo 已在 Hub 上线。
推荐理由:42x 空间压缩带来的训练与推理成本对比有具体数字,适合想低成本跑文生图的读者参考。
Hugging Face Diffusers 团队与 T2I-Adapter 作者合作,为 Stable Diffusion XL 推出 T2I-Adapter 支持,并发布 sketch、canny、lineart、depth、openpose 五种条件的 checkpoints。
推荐理由:原文给出 T2I-Adapter-SDXL 与 ControlNet 的参数量对比、训练配置和完整用法代码,读者可以据此评估并直接上手使用。
TII 发布 Falcon 180B,为当时最大的开放语言模型,拥有 1800 亿参数,使用 RefinedWeb 数据集在 3.5 万亿 token 上完成预训练。
推荐理由:原文给出了参数量、训练规模、评测对比和完整部署硬件门槛,读者可以据此评估是否在自己的场景中采用这个开源模型。
Hugging Face 发布 Code Llama 系列开源代码模型集成,含 7B、13B、34B 三种规格,基于 Llama 2 在 500B token 代码数据上训练,提供 Python 特化版和指令微调版。
推荐理由:官方完整介绍了模型规格、上下文扩展原理和生态接入方式,读者可以直接据此选择规格并上手部署使用。
OpenAI 宣布开发者现在可以使用自有数据对 GPT-3.5 Turbo 进行微调,以适配各自的使用场景,同时带来了相关 API 更新。
Hugging Face 发布开源视觉语言模型 IDEFICS,是 DeepMind 未公开的 Flamingo 的开放复现,接受任意图像和文本序列输入并生成文本,在多个图像文本理解基准上与原闭源模型表现相当。
推荐理由:原文说明了 IDEFICS 基于 Flamingo 的复现路线、参数规模与完全公开数据的训练方式,适合关注开源多模态模型生态的读者。
Segmind 开源了通过 Block-removal 知识蒸馏训练的压缩版 Stable Diffusion 模型 SD-Small 和 SD-Tiny 的权重与训练代码,参数量分别比基础模型少 35% 和 55%,图像保真度相当。
Meta 发布 Llama 2 系列开放模型,包含 7B、13B、70B 预训练及微调版本,采用可商用的 Llama 2 许可证,Hugging Face 同步完成集成并上线全部 12 个模型。
推荐理由:官方完整梳理了 Llama 2 的许可、规格与 HF 生态推理微调路径,读者可据此快速上手开源替代方案。
阿布扎比 Technology Innovation Institute 以 Apache 2.0 许可发布 Falcon-7B 和 Falcon-40B 模型,40B 版当时位列 Open LLM Leaderboard 第一。
推荐理由:原文由 Hugging Face 实测 Falcon 的推理、量化与 QLoRA 微调,并给出显存需求和代码,可直接迁移到自己的部署流程。
RWKV 是一种结合 RNN 与 transformer 优势的新架构,已通过 PR 正式集成到 Hugging Face transformers 库。该架构训练时可并行(类似线性化 GPT),推理时仅需矩阵向量运算、内存不随上下文增长;已有训练上下文长度 8192 的模型与 ctx1024 模型速度和内存相当。
推荐理由:RWKV 结合 RNN 与 transformer 两种架构的优势,官方介绍了其原理、可用模型规模及在 transformers 库中的实际用法。
BigCode(由 Hugging Face 与 ServiceNow 联合主导)发布约 15B 参数的代码大模型 StarCoder 和 StarCoderBase,在 1 万亿 token 上训练,覆盖 80+ 编程语言。
推荐理由:官方发布且附完整评测数据,读者可以据此对比开源代码模型与闭源模型的实际差距。
OpenAI 发布 GPT-4,称其为扩大深度学习规模的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入、输出文本;虽然许多真实场景下仍不及人类,但在多项专业和学术基准上表现出人类水平性能。
推荐理由:官方原文明确 GPT-4 接受图像和文本输入,并在多项专业与学术基准上达到人类水平表现,可据此了解其能力定位。
OpenAI 发布 GPT-4。该模型可在创意和技术写作任务上生成、编辑并与用户迭代,例如创作歌曲、撰写剧本或学习用户的写作风格。
推荐理由:官方宣布 GPT-4 发布,说明其在创意与技术写作任务上的生成、编辑和迭代能力,可作为了解该模型基础能力的入口。
Kakao Brain 与 Hugging Face 发布开源图像文本数据集 COYO-700M,以及基于它训练的 ViT 和 ALIGN 模型,其中 ALIGN 为首个开源版本。
Hugging Face 宣布微软亚洲研究院的 SpeechT5 已在 🤗 Transformers 中可用,官方 checkpoint 发布在 Hub 上。
OpenAI 发布新一代 embedding 模型(嵌入向量模型),能力更强、成本更低、使用更简单。该模型面向文本嵌入场景,可用于语义搜索、检索等任务。
OpenAI 训练了名为 ChatGPT 的对话式交互模型。对话格式使其能回答追问、承认错误、挑战错误前提,并拒绝不当请求。
推荐理由:这是 ChatGPT 的原始发布说明,对话格式带来的追问与纠错能力至今仍是理解其产品形态的起点。
rinna 基于 Stable Diffusion 微调出日语文生图模型 Japanese Stable Diffusion,接受日语提示词并生成反映日语圈文化的图像。
OpenAI 宣布训练并开源名为 Whisper 的神经网络,该模型在英文语音识别上的鲁棒性和准确率接近人类水平。
推荐理由:OpenAI 官方宣布开源 Whisper,读者可以据此了解其在英文语音识别上的准确性与鲁棒性水平。
BigScience 项目发布开源多语言大模型 BLOOM,1760 亿参数,可生成 46 种自然语言和 13 种编程语言的文本。训练历时 117 天,在法国 Jean Zay 超算上完成,涉及 70 多国 250 多个机构的 1000 多名研究者。
推荐理由:大语言模型开源和透明训练的代表性案例,说明了开放协作如何让百亿级参数模型走向可研究、可复用。
OpenAI 发布新版 GPT-3 和 Codex,新增编辑和插入能力,不再只支持对现有文本做补全。
推荐理由:OpenAI 官方宣布 GPT-3 和 Codex 不再只能补全文本,新增编辑与插入能力,读者可据此了解 API 能力边界的变化。
OpenAI 训练出比 GPT-3 更能遵循用户意图、同时更真实且毒性更低的 InstructGPT 模型,采用其对齐研究开发、有人类参与闭环的训练技术。这些模型现已部署为 OpenAI API 的默认语言模型。
推荐理由:OpenAI 官方说明 InstructGPT 的对齐训练思路及其成为 API 默认模型的变化,可帮读者理解当时模型行为取向的调整。
OpenAI 微调 GPT-3 得到 WebGPT,借助文本式网页浏览器更准确地回答开放式问题。该方法旨在提升语言模型回答的事实准确性。
推荐理由:官方说明用文本浏览器微调 GPT-3 回答开放性问题的思路,读者可借此了解检索增强回答的早期做法。