跳到正文

#推理

今日 1 条
2月2日周五
12月20日周三
12月11日周一
  1. Mistral AI83

    Mistral AI 发布开放权重的稀疏混合专家模型 Mixtral 8x7B

    Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可的开放权重稀疏混合专家模型(SMoE),在多数基准上超过 Llama 2 70B 且推理快 6 倍,多数标准基准上匹配或超越 GPT3.5。

    推荐理由:官方给出稀疏专家架构的参数激活比例、基准对比与部署方案,为开源模型选型提供了具体的成本性能参考。

  2. Hugging Face Blog66

    Hugging Face 深入解读 Mixture of Experts(MoE)的原理、训练与推理取舍

    Hugging Face 发布长文系统讲解 MoE(专家混合)架构,以 Mixtral 8x7B 的走红为背景,覆盖稀疏层、路由、负载均衡、Switch Transformers 等核心内容。文章指出 MoE 相同参数量下推理更快、预训练更省算力,但需加载全部参数(Mixtral 8x7B 需按 47B 稠密模型准备显存),且微调更易过拟合,指令微调等新方向有望缓解这一短板。

    推荐理由:这篇解读把 MoE 的结构、路由、负载均衡和微调取舍讲成一条完整脉络,读完能自己判断何时该选稀疏 MoE 而非稠密模型。

12月5日周二
9月27日周三
  1. Mistral AI81

    Mistral AI 发布开源模型 Mistral 7B

    Mistral AI 发布 7.3B 参数开源模型 Mistral 7B,采用 Apache 2.0 许可证,在所有基准上超越 Llama 2 13B,并在多数基准上优于 Llama 1 34B。

    推荐理由:官方给出与 Llama 2 全面对比的评测数据和架构改进细节,读者可据此评估 7B 级开源模型的性价比与部署选择。

9月6日周三
5月31日周三
  1. OpenAI News67

    OpenAI 用过程监督提升模型数学推理能力

    OpenAI 训练模型在数学问题求解上取得新的 SOTA,方法是对每一步正确推理给予奖励(process supervision),而非只奖励最终正确答案(outcome supervision)。除性能优于结果监督外,过程监督还有对齐上的好处,直接训练模型产出人类认可的思维链。

    推荐理由:原文说明了过程监督相对结果监督的性能与对齐优势,帮助读者理解链式推理训练的一个方向。

5月11日周四
  1. Hugging Face Blog68

    Hugging Face 发布 Assisted Generation 解码方法,文本生成延迟最多降低 10 倍

    Hugging Face 在 Transformers 中推出 Assisted Generation 解码方法,用小模型生成候选 token、大模型前向传播验证,降低自回归文本生成延迟。

    推荐理由:原文解释了文本生成延迟来自内存带宽而非计算,并给出 Assisted Generation 的原理、代码和延迟数据,方法可直接复现。

4月5日周三
3月14日周二
  1. OpenAI News94

    OpenAI 发布多模态大模型 GPT-4

    OpenAI 发布 GPT-4,称其为扩大深度学习规模的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入、输出文本;虽然许多真实场景下仍不及人类,但在多项专业和学术基准上表现出人类水平性能。

    推荐理由:官方原文明确 GPT-4 接受图像和文本输入,并在多项专业与学术基准上达到人类水平表现,可据此了解其能力定位。

1月24日周二
  1. Hugging Face Blog62

    Hugging Face 解析什么让对话智能体有用:RLHF、IFT、CoT 技术综述

    Hugging Face 发布博客,系统梳理让对话智能体有用的关键技术 RLHF、IFT、SFT、CoT 与红队测试,并对比 LaMDA、BlenderBot 3、Sparrow、InstructGPT 与 Anthropic Assistant 的训练数据、模型规模与评估标准。文章指出指令微调所需数据远小于预训练,CoT 微调能提升逐步推理任务表现并减少对敏感话题的回避。

    推荐理由:文章系统梳理了 RLHF、IFT、SFT、CoT 等技术如何让对话智能体有用,并对比主流模型差异。

1月3日周二
  1. Hugging Face Blog34

    图机器学习入门

    Hugging Face 发布图机器学习入门教程,讲解图的基本概念、表示方法及应用任务,涵盖图级、节点级、边级和子图级任务,如 AlphaFold 的节点属性预测和推荐系统中的缺失边预测。文章依次介绍从前神经网络方法到图神经网络(GNN)的学习方式,并简要探讨面向图的 Transformer,聚焦同质图,区分 transductive 与 inductive 两种设置。

9月26日周一
  1. Hugging Face Blog68

    Hugging Face 与 Intel Labs、UKP Lab 发布少样本分类框架 SetFit

    Hugging Face 联合 Intel Labs 和 UKP Lab 发布 SetFit,一个无需提示词的少样本文本分类框架。每类仅需 8 个标注样本即可在 Customer Reviews 数据集上媲美用全量 3k 样本微调的 RoBERTa Large;在 RAFT 基准上 355M 参数的 SetFit 超过 PET 和 GPT-3。

    推荐理由:官方详解 SetFit 的原理、训练成本和 RAFT 实测数据,并附可复现的训练代码,方便直接上手做少样本分类。

5月4日周三
3月28日周一
2月2日周三
10月29日周五
6月3日周四
3月9日周二
10月10日周六
  1. Hugging Face Blog51

    Hugging Face 详解基于 Transformer 的编码器-解码器模型

    Hugging Face 发布长文教程,详解基于 Transformer 的编码器-解码器架构如何建模序列到序列任务。文章从 RNN 编码器-解码器模型的历史讲起,分解编码器的双向自注意力与解码器的单向自注意力和交叉注意力机制,并以 MarianMT 模型代码演示 .generate() 自回归推理,涵盖 T5、Bart、Pegasus 等模型背景,但不涉及训练方法。

7月3日周五
3月1日周日
10月15日周二
  1. OpenAI News64

    OpenAI 用机器手求解魔方,训练完全在仿真中完成

    OpenAI 训练了一对神经网络,用仿人机器手还原魔方,训练完全在仿真中进行,采用与 OpenAI Five 相同的强化学习代码和新技术 Automatic Domain Randomization(ADR)。系统能应对训练中未见过的情况,例如被长颈鹿玩偶戳动,表明强化学习可解决需要极高灵巧度的现实物理问题。

    推荐理由:原文说明神经网络完全在仿真中训练即可操控机械手还原魔方,并给出 ADR 这一可迁移到其他物理任务的方法。

2月14日周四
  1. OpenAI News81

    OpenAI 训练大规模无监督语言模型,无需任务特定训练即可完成多任务

    OpenAI 训练了一个大规模无监督语言模型,能生成连贯段落文本,在多项语言建模基准上达到当时最优表现。该模型无需任务特定训练即可完成基础阅读理解、机器翻译、问答和摘要任务。

    推荐理由:OpenAI 自述该无监督语言模型在多项基准上达到 SOTA 并零样本完成多任务,可作为了解无任务特定训练能力的背景材料。

11月7日周三
10月31日周三
10月22日周一
  1. OpenAI News36

    OpenAI 提出 AI 安全新技术 iterated amplification

    OpenAI 提出一项名为 iterated amplification 的 AI 安全技术,通过演示如何把任务分解为更简单的子任务,来指定超越人类规模的复杂行为和目标,而无需提供标注数据或奖励函数。目前该想法仍处早期阶段,实验仅在简单的玩具算法领域完成,但 OpenAI 认为其可能成为可扩展的 AI 安全方法。

7月4日周三
6月25日周一
6月11日周一
  1. OpenAI News78

    OpenAI 发布基于 Transformer 与无监督预训练的语言理解系统

    OpenAI 宣布以可扩展、任务无关的系统在多项多样化语言任务上取得 SOTA 结果,并开放发布该系统。方法结合 Transformer 与无监督预训练两个已有思路,团队认为结果证明了监督学习搭配无监督预训练的有效性,希望推动在更大更多样数据集上的进一步研究。

    推荐理由:原文给出无监督预训练加 Transformer 的方法组合和多任务 SOTA 结果,可帮读者理解预训练思路的实际成效。

8月11日周五
  1. OpenAI News65

    OpenAI 自对弈 Dota 2 bot 在 1v1 标准赛事规则下击败世界顶尖职业选手

    OpenAI 宣布其 Dota 2 bot 在标准赛事规则的 1v1 对局中击败世界顶尖职业选手。该 bot 从零开始通过自对弈学习,不使用模仿学习或树搜索。作者称这是向在涉及真实人类的混乱复杂环境中完成明确目标的 AI 系统迈出的一步。

    推荐理由:原文点明该 bot 完全靠自对弈从零学习、不用模仿学习和树搜索,可帮助读者理解其在复杂环境 AI 中的定位。