跳到正文

全部动态

今日 4 条
9月25日周一
9月13日周三
  1. Hugging Face Blog65

    Hugging Face 发布 Würstchen 快速文生图扩散模型

    Hugging Face 发布 Würstchen,一种在高度压缩潜空间中工作的文生图扩散模型,实现 42x 空间压缩。生成速度明显快于 SDXL 且内存占用更低;Würstchen v2 训练用 24,602 GPU 小时,支持最高 1536 分辨率,已集成进 Diffusers,模型权重和 Demo 已在 Hub 上线。

    推荐理由:42x 空间压缩带来的训练与推理成本对比有具体数字,适合想低成本跑文生图的读者参考。

9月6日周三
8月25日周五
  1. Hugging Face Blog83

    Code Llama 发布:Llama 2 代码特化系列模型接入 Hugging Face 生态

    Hugging Face 发布 Code Llama 系列开源代码模型集成,含 7B、13B、34B 三种规格,基于 Llama 2 在 500B token 代码数据上训练,提供 Python 特化版和指令微调版。

    推荐理由:官方完整介绍了模型规格、上下文扩展原理和生态接入方式,读者可以直接据此选择规格并上手部署使用。

8月22日周二
  1. Hugging Face Blog71

    Hugging Face 发布开源视觉语言模型 IDEFICS,复现 Flamingo

    Hugging Face 发布开源视觉语言模型 IDEFICS,是 DeepMind 未公开的 Flamingo 的开放复现,接受任意图像和文本序列输入并生成文本,在多个图像文本理解基准上与原闭源模型表现相当。

    推荐理由:原文说明了 IDEFICS 基于 Flamingo 的复现路线、参数规模与完全公开数据的训练方式,适合关注开源多模态模型生态的读者。

8月1日周二
7月18日周二
6月5日周一
5月15日周一
  1. Hugging Face Blog64

    RWKV 架构接入 Hugging Face transformers 库:兼具 RNN 与 transformer 优势

    RWKV 是一种结合 RNN 与 transformer 优势的新架构,已通过 PR 正式集成到 Hugging Face transformers 库。该架构训练时可并行(类似线性化 GPT),推理时仅需矩阵向量运算、内存不随上下文增长;已有训练上下文长度 8192 的模型与 ctx1024 模型速度和内存相当。

    推荐理由:RWKV 结合 RNN 与 transformer 两种架构的优势,官方介绍了其原理、可用模型规模及在 transformers 库中的实际用法。

5月4日周四
3月14日周二
  1. OpenAI News94

    OpenAI 发布多模态大模型 GPT-4

    OpenAI 发布 GPT-4,称其为扩大深度学习规模的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入、输出文本;虽然许多真实场景下仍不及人类,但在多项专业和学术基准上表现出人类水平性能。

    推荐理由:官方原文明确 GPT-4 接受图像和文本输入,并在多项专业与学术基准上达到人类水平表现,可据此了解其能力定位。

  2. OpenAI News92

    OpenAI 发布 GPT-4

    OpenAI 发布 GPT-4。该模型可在创意和技术写作任务上生成、编辑并与用户迭代,例如创作歌曲、撰写剧本或学习用户的写作风格。

    推荐理由:官方宣布 GPT-4 发布,说明其在创意与技术写作任务上的生成、编辑和迭代能力,可作为了解该模型基础能力的入口。

3月6日周一
1月19日周四
12月15日周四
10月5日周三
9月21日周三
7月12日周二
  1. Hugging Face Blog74

    Hugging Face 发布 176B 参数开源多语言大模型 BLOOM

    BigScience 项目发布开源多语言大模型 BLOOM,1760 亿参数,可生成 46 种自然语言和 13 种编程语言的文本。训练历时 117 天,在法国 Jean Zay 超算上完成,涉及 70 多国 250 多个机构的 1000 多名研究者。

    推荐理由:大语言模型开源和透明训练的代表性案例,说明了开放协作如何让百亿级参数模型走向可研究、可复用。

3月15日周二
2月2日周三
1月27日周四
  1. OpenAI News77

    OpenAI 发布 InstructGPT 并设为 API 默认语言模型

    OpenAI 训练出比 GPT-3 更能遵循用户意图、同时更真实且毒性更低的 InstructGPT 模型,采用其对齐研究开发、有人类参与闭环的训练技术。这些模型现已部署为 OpenAI API 的默认语言模型。

    推荐理由:OpenAI 官方说明 InstructGPT 的对齐训练思路及其成为 API 默认模型的变化,可帮读者理解当时模型行为取向的调整。

12月16日周四
12月15日周三
  1. Hugging Face Blog47

    Perceiver IO:可扩展的全注意力模型,可处理任意模态

    Hugging Face 将 Perceiver IO 加入 Transformers 库,这是首个能处理文本、图像、音频、视频、点云等多种模态及其组合的 Transformer 神经网络。该模型在 256 或 512 个 latent 变量上执行自注意力,使计算量与输入大小呈线性关系而非平方依赖。官方提供了预测光流和图像分类的 Spaces 示例及多个 notebook。

1月5日周二
  1. OpenAI News77

    OpenAI 发布 CLIP:连接文本与图像的神经网络

    OpenAI 发布神经网络 CLIP,可从自然语言监督中高效学习视觉概念。只需提供待识别视觉类别名称,即可应用于任何视觉分类基准,类似 GPT-2 和 GPT-3 的零样本能力。

    推荐理由:OpenAI 官方介绍 CLIP 如何用自然语言监督学习视觉概念,零样本思路可与 GPT 系列对照理解。

4月30日周四
  1. OpenAI News63

    OpenAI 发布 Jukebox 神经网络,可生成多种风格音乐与初阶人声

    OpenAI 推出 Jukebox,一个能以原始音频形式生成多种流派和艺术家风格音乐、包括初阶演唱的神经网络。官方同时发布了模型权重和代码,并提供探索生成样本的工具。

    推荐理由:原文说明了模型能以原始音频生成多风格歌曲并开源权重与代码,读者可自行探索生成样本。

11月5日周二
  1. OpenAI News78

    OpenAI 发布 GPT-2 最大版本 1.5B 参数模型

    OpenAI 发布 GPT-2 分阶段计划的最终模型,即最大版本 1.5B 参数,同时放出代码和模型权重以帮助检测 GPT-2 的输出。OpenAI 表示虽自 8 月以来已有更大模型出现,仍按原计划完成完整的分阶段发布流程,为社区提供负责任发布的测试案例。

    推荐理由:原文交代了 GPT-2 1.5B 作为分阶段发布最终版的开放决策与考量,读者可以了解负责任发布实践的完整案例。

10月15日周二
  1. OpenAI News64

    OpenAI 用机器手求解魔方,训练完全在仿真中完成

    OpenAI 训练了一对神经网络,用仿人机器手还原魔方,训练完全在仿真中进行,采用与 OpenAI Five 相同的强化学习代码和新技术 Automatic Domain Randomization(ADR)。系统能应对训练中未见过的情况,例如被长颈鹿玩偶戳动,表明强化学习可解决需要极高灵巧度的现实物理问题。

    推荐理由:原文说明神经网络完全在仿真中训练即可操控机械手还原魔方,并给出 ADR 这一可迁移到其他物理任务的方法。

8月20日周二
  1. OpenAI News63

    OpenAI 发布 774M 参数 GPT-2 模型并公开发布规范经验

    OpenAI 在 2 月发布 124M、5 月分阶段发布 355M 之后,发布 774M 参数的 GPT-2 语言模型。同时发布一份开源法律协议,便于机构间建立模型共享合作,并发布技术报告,总结与 AI 研究社区协调发布规范的经验。

    推荐理由:OpenAI 官方复盘分阶段释放 774M GPT-2 的决策过程,可了解滥用风险评估如何影响模型发布策略。

4月25日周四
  1. OpenAI News38

    OpenAI 发布 MuseNet:可生成 10 种乐器演奏、融合多种风格的 4 分钟乐曲

    OpenAI 推出深度神经网络 MuseNet,能生成 10 种不同乐器演奏的 4 分钟乐曲,风格可从乡村音乐跨越到 Mozart 和 Beatles。MuseNet 并未显式编写音乐知识,而是通过在数十万 MIDI 文件上预测下一个 token,自行学会和声、节奏与风格规律。它与 GPT-2 采用相同的大规模 Transformer 无监督通用技术。

4月15日周一
  1. OpenAI News78

    OpenAI Five 在直播中连胜两局击败 Dota 2 世界冠军 OG

    OpenAI Five 在周末决赛中连胜两局击败 Dota 2 世界冠军战队 OG,成为首个战胜电竞世界冠军的 AI。OpenAI Five 和 DeepMind 的 AlphaStar 此前都曾私下战胜过职业选手但输掉过公开职业比赛,这也是 AI 首次在直播中战胜电竞职业选手。

    推荐理由:作者本人披露了此前直播对局的失利背景,可帮读者理解这次公开战胜世界冠军与以往私下对局的差别。

2月14日周四
  1. OpenAI News81

    OpenAI 训练大规模无监督语言模型,无需任务特定训练即可完成多任务

    OpenAI 训练了一个大规模无监督语言模型,能生成连贯段落文本,在多项语言建模基准上达到当时最优表现。该模型无需任务特定训练即可完成基础阅读理解、机器翻译、问答和摘要任务。

    推荐理由:OpenAI 自述该无监督语言模型在多项基准上达到 SOTA 并零样本完成多任务,可作为了解无任务特定训练能力的背景材料。

8月23日周四
8月6日周一
  1. OpenAI News66

    OpenAI Five Benchmark 击败99.95百分位Dota选手队伍

    OpenAI Five 在三局两胜制比赛中击败由 Blitz、Cap、Fogged、Merlini 和 MoonMeander 组成的99.95百分位 Dota 选手队伍,其中四人有过职业 Dota 经历。比赛在有现场观众的直播中进行,直播同时在线人数达 100,000。

    推荐理由:官方公布了 OpenAI Five 战胜高分段 Dota 选手的比分和对手阵容,读者可以了解这场人机对决的实际结果与规模。

7月18日周三
6月25日周一
6月11日周一
  1. OpenAI News78

    OpenAI 发布基于 Transformer 与无监督预训练的语言理解系统

    OpenAI 宣布以可扩展、任务无关的系统在多项多样化语言任务上取得 SOTA 结果,并开放发布该系统。方法结合 Transformer 与无监督预训练两个已有思路,团队认为结果证明了监督学习搭配无监督预训练的有效性,希望推动在更大更多样数据集上的进一步研究。

    推荐理由:原文给出无监督预训练加 Transformer 的方法组合和多任务 SOTA 结果,可帮读者理解预训练思路的实际成效。

5月3日周四
2月7日周三
10月19日周四