OpenAI 发布 GPT-4V(ision) 系统卡
OpenAI 发布 GPT-4V(ision) 系统卡,说明其图像输入能力及相关评估情况。抓取内容仅含标题,正文细节不可得。
OpenAI 发布 GPT-4V(ision) 系统卡,说明其图像输入能力及相关评估情况。抓取内容仅含标题,正文细节不可得。
Hugging Face 发布 Würstchen,一种在高度压缩潜空间中工作的文生图扩散模型,实现 42x 空间压缩。生成速度明显快于 SDXL 且内存占用更低;Würstchen v2 训练用 24,602 GPU 小时,支持最高 1536 分辨率,已集成进 Diffusers,模型权重和 Demo 已在 Hub 上线。
推荐理由:42x 空间压缩带来的训练与推理成本对比有具体数字,适合想低成本跑文生图的读者参考。
TII 发布 Falcon 180B,为当时最大的开放语言模型,拥有 1800 亿参数,使用 RefinedWeb 数据集在 3.5 万亿 token 上完成预训练。
推荐理由:原文给出了参数量、训练规模、评测对比和完整部署硬件门槛,读者可以据此评估是否在自己的场景中采用这个开源模型。
Hugging Face 发布 Code Llama 系列开源代码模型集成,含 7B、13B、34B 三种规格,基于 Llama 2 在 500B token 代码数据上训练,提供 Python 特化版和指令微调版。
推荐理由:官方完整介绍了模型规格、上下文扩展原理和生态接入方式,读者可以直接据此选择规格并上手部署使用。
Hugging Face 发布开源视觉语言模型 IDEFICS,是 DeepMind 未公开的 Flamingo 的开放复现,接受任意图像和文本序列输入并生成文本,在多个图像文本理解基准上与原闭源模型表现相当。
推荐理由:原文说明了 IDEFICS 基于 Flamingo 的复现路线、参数规模与完全公开数据的训练方式,适合关注开源多模态模型生态的读者。
Segmind 开源了通过 Block-removal 知识蒸馏训练的压缩版 Stable Diffusion 模型 SD-Small 和 SD-Tiny 的权重与训练代码,参数量分别比基础模型少 35% 和 55%,图像保真度相当。
Meta 发布 Llama 2 系列开放模型,包含 7B、13B、70B 预训练及微调版本,采用可商用的 Llama 2 许可证,Hugging Face 同步完成集成并上线全部 12 个模型。
推荐理由:官方完整梳理了 Llama 2 的许可、规格与 HF 生态推理微调路径,读者可据此快速上手开源替代方案。
阿布扎比 Technology Innovation Institute 以 Apache 2.0 许可发布 Falcon-7B 和 Falcon-40B 模型,40B 版当时位列 Open LLM Leaderboard 第一。
推荐理由:原文由 Hugging Face 实测 Falcon 的推理、量化与 QLoRA 微调,并给出显存需求和代码,可直接迁移到自己的部署流程。
RWKV 是一种结合 RNN 与 transformer 优势的新架构,已通过 PR 正式集成到 Hugging Face transformers 库。该架构训练时可并行(类似线性化 GPT),推理时仅需矩阵向量运算、内存不随上下文增长;已有训练上下文长度 8192 的模型与 ctx1024 模型速度和内存相当。
推荐理由:RWKV 结合 RNN 与 transformer 两种架构的优势,官方介绍了其原理、可用模型规模及在 transformers 库中的实际用法。
BigCode(由 Hugging Face 与 ServiceNow 联合主导)发布约 15B 参数的代码大模型 StarCoder 和 StarCoderBase,在 1 万亿 token 上训练,覆盖 80+ 编程语言。
推荐理由:官方发布且附完整评测数据,读者可以据此对比开源代码模型与闭源模型的实际差距。
OpenAI 发布 GPT-4,称其为扩大深度学习规模的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入、输出文本;虽然许多真实场景下仍不及人类,但在多项专业和学术基准上表现出人类水平性能。
推荐理由:官方原文明确 GPT-4 接受图像和文本输入,并在多项专业与学术基准上达到人类水平表现,可据此了解其能力定位。
OpenAI 发布 GPT-4。该模型可在创意和技术写作任务上生成、编辑并与用户迭代,例如创作歌曲、撰写剧本或学习用户的写作风格。
推荐理由:官方宣布 GPT-4 发布,说明其在创意与技术写作任务上的生成、编辑和迭代能力,可作为了解该模型基础能力的入口。
Kakao Brain 与 Hugging Face 发布开源图像文本数据集 COYO-700M,以及基于它训练的 ViT 和 ALIGN 模型,其中 ALIGN 为首个开源版本。
Hugging Face 发文介绍 Mask2Former 和 OneFormer 两个通用图像分割模型现已进入 transformers 库。
OpenAI 发布新一代 embedding 模型(嵌入向量模型),能力更强、成本更低、使用更简单。该模型面向文本嵌入场景,可用于语义搜索、检索等任务。
rinna 基于 Stable Diffusion 微调出日语文生图模型 Japanese Stable Diffusion,接受日语提示词并生成反映日语圈文化的图像。
OpenAI 宣布训练并开源名为 Whisper 的神经网络,该模型在英文语音识别上的鲁棒性和准确率接近人类水平。
推荐理由:OpenAI 官方宣布开源 Whisper,读者可以据此了解其在英文语音识别上的准确性与鲁棒性水平。
BigScience 项目发布开源多语言大模型 BLOOM,1760 亿参数,可生成 46 种自然语言和 13 种编程语言的文本。训练历时 117 天,在法国 Jean Zay 超算上完成,涉及 70 多国 250 多个机构的 1000 多名研究者。
推荐理由:大语言模型开源和透明训练的代表性案例,说明了开放协作如何让百亿级参数模型走向可研究、可复用。
OpenAI 发布新版 GPT-3 和 Codex,新增编辑和插入能力,不再只支持对现有文本做补全。
推荐理由:OpenAI 官方宣布 GPT-3 和 Codex 不再只能补全文本,新增编辑与插入能力,读者可据此了解 API 能力边界的变化。
OpenAI 构建了一个面向 Lean 的神经定理证明器,能解多种有挑战性的高中奥赛题,包括 AMC12 和 AIME 竞赛题,以及两道由 IMO 改编的题目。
OpenAI 训练出比 GPT-3 更能遵循用户意图、同时更真实且毒性更低的 InstructGPT 模型,采用其对齐研究开发、有人类参与闭环的训练技术。这些模型现已部署为 OpenAI API 的默认语言模型。
推荐理由:OpenAI 官方说明 InstructGPT 的对齐训练思路及其成为 API 默认模型的变化,可帮读者理解当时模型行为取向的调整。
OpenAI 微调 GPT-3 得到 WebGPT,借助文本式网页浏览器更准确地回答开放式问题。该方法旨在提升语言模型回答的事实准确性。
推荐理由:官方说明用文本浏览器微调 GPT-3 回答开放性问题的思路,读者可借此了解检索增强回答的早期做法。
Hugging Face 将 Perceiver IO 加入 Transformers 库,这是首个能处理文本、图像、音频、视频、点云等多种模态及其组合的 Transformer 神经网络。该模型在 256 或 512 个 latent 变量上执行自注意力,使计算量与输入大小呈线性关系而非平方依赖。官方提供了预测光流和图像分类的 Spaces 示例及多个 notebook。
OpenAI 发布神经网络 CLIP,可从自然语言监督中高效学习视觉概念。只需提供待识别视觉类别名称,即可应用于任何视觉分类基准,类似 GPT-2 和 GPT-3 的零样本能力。
推荐理由:OpenAI 官方介绍 CLIP 如何用自然语言监督学习视觉概念,零样本思路可与 GPT 系列对照理解。
OpenAI 训练了名为 DALL·E 的神经网络,可从文本描述生成图像,覆盖自然语言可表达的广泛概念。
推荐理由:原文说明 DALL·E 能根据自然语言文本描述生成图像,是文本生成图像方向的早期代表工作。
OpenAI 推出 Jukebox,一个能以原始音频形式生成多种流派和艺术家风格音乐、包括初阶演唱的神经网络。官方同时发布了模型权重和代码,并提供探索生成样本的工具。
推荐理由:原文说明了模型能以原始音频生成多风格歌曲并开源权重与代码,读者可自行探索生成样本。
OpenAI 发布 GPT-2 分阶段计划的最终模型,即最大版本 1.5B 参数,同时放出代码和模型权重以帮助检测 GPT-2 的输出。OpenAI 表示虽自 8 月以来已有更大模型出现,仍按原计划完成完整的分阶段发布流程,为社区提供负责任发布的测试案例。
推荐理由:原文交代了 GPT-2 1.5B 作为分阶段发布最终版的开放决策与考量,读者可以了解负责任发布实践的完整案例。
OpenAI 训练了一对神经网络,用仿人机器手还原魔方,训练完全在仿真中进行,采用与 OpenAI Five 相同的强化学习代码和新技术 Automatic Domain Randomization(ADR)。系统能应对训练中未见过的情况,例如被长颈鹿玩偶戳动,表明强化学习可解决需要极高灵巧度的现实物理问题。
推荐理由:原文说明神经网络完全在仿真中训练即可操控机械手还原魔方,并给出 ADR 这一可迁移到其他物理任务的方法。
OpenAI 在 2 月发布 124M、5 月分阶段发布 355M 之后,发布 774M 参数的 GPT-2 语言模型。同时发布一份开源法律协议,便于机构间建立模型共享合作,并发布技术报告,总结与 AI 研究社区协调发布规范的经验。
推荐理由:OpenAI 官方复盘分阶段释放 774M GPT-2 的决策过程,可了解滥用风险评估如何影响模型发布策略。
OpenAI 推出深度神经网络 MuseNet,能生成 10 种不同乐器演奏的 4 分钟乐曲,风格可从乡村音乐跨越到 Mozart 和 Beatles。MuseNet 并未显式编写音乐知识,而是通过在数十万 MIDI 文件上预测下一个 token,自行学会和声、节奏与风格规律。它与 GPT-2 采用相同的大规模 Transformer 无监督通用技术。
OpenAI Five 在周末决赛中连胜两局击败 Dota 2 世界冠军战队 OG,成为首个战胜电竞世界冠军的 AI。OpenAI Five 和 DeepMind 的 AlphaStar 此前都曾私下战胜过职业选手但输掉过公开职业比赛,这也是 AI 首次在直播中战胜电竞职业选手。
推荐理由:作者本人披露了此前直播对局的失利背景,可帮读者理解这次公开战胜世界冠军与以往私下对局的差别。
OpenAI 训练了一个大规模无监督语言模型,能生成连贯段落文本,在多项语言建模基准上达到当时最优表现。该模型无需任务特定训练即可完成基础阅读理解、机器翻译、问答和摘要任务。
推荐理由:OpenAI 自述该无监督语言模型在多项基准上达到 SOTA 并零样本完成多任务,可作为了解无任务特定训练能力的背景材料。
OpenAI Five 在温哥华 The International 2018 上与顶级 Dota 2 选手对战两局均告负,两局中 OpenAI Five 在前 20-35 分钟内保持较大获胜机会。
OpenAI Five 在三局两胜制比赛中击败由 Blitz、Cap、Fogged、Merlini 和 MoonMeander 组成的99.95百分位 Dota 选手队伍,其中四人有过职业 Dota 经历。比赛在有现场观众的直播中进行,直播同时在线人数达 100,000。
推荐理由:官方公布了 OpenAI Five 战胜高分段 Dota 选手的比分和对手阵容,读者可以了解这场人机对决的实际结果与规模。
OpenAI 宣布 OpenAI Five Benchmark 比赛已经结束。
OpenAI 宣布其由五个神经网络组成的系统 OpenAI Five,已开始在 Dota 2 中击败业余人类队伍。
OpenAI 宣布以可扩展、任务无关的系统在多项多样化语言任务上取得 SOTA 结果,并开放发布该系统。方法结合 Transformer 与无监督预训练两个已有思路,团队认为结果证明了监督学习搭配无监督预训练的有效性,希望推动在更大更多样数据集上的进一步研究。
推荐理由:原文给出无监督预训练加 Transformer 的方法组合和多任务 SOTA 结果,可帮读者理解预训练思路的实际成效。
OpenAI 提出一项 AI 安全技术,训练多个智能体就某个主题相互辩论,由人类判断哪一方获胜,以此辅助对齐。
OpenAI 构建了一套实体消歧系统,由神经网络判断词语是否属于约 100 个自动发现的“类型”(非互斥类别),从而自动确定词语所指的对象。
OpenAI 最新的机器人技术让完全在仿真中训练的机器人控制器能部署到实体机器人上,并在解决简单任务时对环境中未计划的变化做出反应。借助这些技术,OpenAI 构建了闭环系统,而非此前的开环系统。