跳到正文

#推理

今日 0 条
11月19日周二
10月29日周二
  1. Hugging Face Blog65

    Intel Labs 与 Hugging Face 推出 Universal Assisted Generation,跨模型家族加速解码 1.5x-2.0x

    Intel Labs 与 Hugging Face 推出 Universal Assisted Generation(UAG),通过双向 tokenizer 翻译让辅助生成不再要求目标模型与助手模型共享同一 tokenizer,可将任意 decoder 或 MoE 模型的推理加速 1.5x-2.0x 且几乎零开销。

    推荐理由:原文解释了跨 tokenizer 助手模型的实现原理并给出多组加速数据,还提供 Transformers 4.46.0 的可用代码。

10月8日周二
9月12日周四
  1. OpenAI News64

    OpenAI 发布 o1-mini,主打高性价比推理

    OpenAI 官宣 o1-mini,定位为更具成本效益的推理模型。原文正文缺失,仅提供标题与副标题“Advancing cost-efficient reasoning”,具体能力、定价和可用性细节以官方后续说明为准。

    推荐理由:官方原文仅给出标题与口号,正文缺失,难以提炼具体阅读价值。

7月24日周三
7月18日周四
  1. Mistral AI70

    Mistral 与 NVIDIA 联合发布 12B 开源模型 Mistral NeMo

    Mistral AI 与 NVIDIA 联合发布 12B 模型 Mistral NeMo,支持 128k 上下文窗口,以 Apache 2.0 许可发布 base 与 instruct 权重,官方称其推理、世界知识和编码精度在该规模中达到 SOTA,可作 Mistral 7B 的直接替代。

    推荐理由:官方原文给出 12B 规模、128k 上下文、Apache 2.0 权重和 Tekken 分词器的具体压缩数据,可据此评估其在 Mistral 7B 系统中的替换价值。

7月17日周三
7月16日周二
7月11日周四
5月16日周四
5月13日周一
  1. OpenAI News81

    OpenAI 发布新旗舰模型 GPT-4o

    OpenAI 宣布推出新旗舰模型 GPT-4o(GPT-4 Omni),该模型可实时对音频、视觉和文本进行推理。

    推荐理由:官方宣布新旗舰模型 GPT-4o,可实时跨音频、视觉和文本推理,是了解该模型定位的直接信源。

4月30日周二
4月23日周二
  1. Hugging Face Blog38

    Hugging Face 推出 Open CoT Leaderboard 链式推理排行榜

    Hugging Face 推出 Open CoT Leaderboard,追踪 LLM 生成有效链式推理的能力。榜单不评绝对准确率,而是计算有无 CoT 提示的准确率差值 Δ,以检验 CoT 对准确率的实际影响,并对训练数据污染更稳健。评测采用 LogiQA 和 LSAT 数据集(多数属于 AGIEval),任务以选择题形式呈现,目前已实现 Classic 和 Reflect 两种提示策略。

4月17日周三
  1. Mistral AI72

    Mistral AI 开源发布 Mixtral 8x22B 稀疏 MoE 模型

    Mistral AI 开源发布 Mixtral 8x22B,采用 Apache 2.0 许可证。该稀疏 MoE 模型总参数 141B、激活参数仅 39B,支持英语、法语、意大利语、德语和西班牙语,具备函数调用能力与 64K tokens 上下文窗口,官方称其速度快于任何稠密 70B 模型。

    推荐理由:官方给出了参数结构、许可证和基准成绩,读者可据此评估它在大模型开源阵营中的性价比和适用场景。

2月26日周一
  1. Mistral AI75

    Mistral 发布旗舰模型 Mistral Large 与低延迟 Mistral Small

    Mistral 发布旗舰语言模型 Mistral Large,称其在常用基准上仅次于 GPT-4,可通过 la Plateforme 和 Azure 使用,支持 32K tokens 上下文、英法德西意多语言、function calling 和 JSON 输出。同时发布优化延迟与成本的 Mistral Small,性能超过 Mixtral 8x7B,并简化了端点产品线、新增多币种定价。

    推荐理由:官方给出了 Mistral Large 的基准对比、多语言与 function calling 能力,读者可据此评估它在 API 可用模型中的位置。

2月2日周五
12月20日周三
12月11日周一
  1. Mistral AI83

    Mistral AI 发布开放权重的稀疏混合专家模型 Mixtral 8x7B

    Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可的开放权重稀疏混合专家模型(SMoE),在多数基准上超过 Llama 2 70B 且推理快 6 倍,多数标准基准上匹配或超越 GPT3.5。

    推荐理由:官方给出稀疏专家架构的参数激活比例、基准对比与部署方案,为开源模型选型提供了具体的成本性能参考。

  2. Hugging Face Blog66

    Hugging Face 深入解读 Mixture of Experts(MoE)的原理、训练与推理取舍

    Hugging Face 发布长文系统讲解 MoE(专家混合)架构,以 Mixtral 8x7B 的走红为背景,覆盖稀疏层、路由、负载均衡、Switch Transformers 等核心内容。文章指出 MoE 相同参数量下推理更快、预训练更省算力,但需加载全部参数(Mixtral 8x7B 需按 47B 稠密模型准备显存),且微调更易过拟合,指令微调等新方向有望缓解这一短板。

    推荐理由:这篇解读把 MoE 的结构、路由、负载均衡和微调取舍讲成一条完整脉络,读完能自己判断何时该选稀疏 MoE 而非稠密模型。

12月5日周二
9月27日周三
  1. Mistral AI81

    Mistral AI 发布开源模型 Mistral 7B

    Mistral AI 发布 7.3B 参数开源模型 Mistral 7B,采用 Apache 2.0 许可证,在所有基准上超越 Llama 2 13B,并在多数基准上优于 Llama 1 34B。

    推荐理由:官方给出与 Llama 2 全面对比的评测数据和架构改进细节,读者可据此评估 7B 级开源模型的性价比与部署选择。

9月6日周三
5月31日周三
  1. OpenAI News67

    OpenAI 用过程监督提升模型数学推理能力

    OpenAI 训练模型在数学问题求解上取得新的 SOTA,方法是对每一步正确推理给予奖励(process supervision),而非只奖励最终正确答案(outcome supervision)。除性能优于结果监督外,过程监督还有对齐上的好处,直接训练模型产出人类认可的思维链。

    推荐理由:原文说明了过程监督相对结果监督的性能与对齐优势,帮助读者理解链式推理训练的一个方向。

5月11日周四
  1. Hugging Face Blog68

    Hugging Face 发布 Assisted Generation 解码方法,文本生成延迟最多降低 10 倍

    Hugging Face 在 Transformers 中推出 Assisted Generation 解码方法,用小模型生成候选 token、大模型前向传播验证,降低自回归文本生成延迟。

    推荐理由:原文解释了文本生成延迟来自内存带宽而非计算,并给出 Assisted Generation 的原理、代码和延迟数据,方法可直接复现。

4月5日周三
3月14日周二
  1. OpenAI News94

    OpenAI 发布多模态大模型 GPT-4

    OpenAI 发布 GPT-4,称其为扩大深度学习规模的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入、输出文本;虽然许多真实场景下仍不及人类,但在多项专业和学术基准上表现出人类水平性能。

    推荐理由:官方原文明确 GPT-4 接受图像和文本输入,并在多项专业与学术基准上达到人类水平表现,可据此了解其能力定位。

1月24日周二
  1. Hugging Face Blog62

    Hugging Face 解析什么让对话智能体有用:RLHF、IFT、CoT 技术综述

    Hugging Face 发布博客,系统梳理让对话智能体有用的关键技术 RLHF、IFT、SFT、CoT 与红队测试,并对比 LaMDA、BlenderBot 3、Sparrow、InstructGPT 与 Anthropic Assistant 的训练数据、模型规模与评估标准。文章指出指令微调所需数据远小于预训练,CoT 微调能提升逐步推理任务表现并减少对敏感话题的回避。

    推荐理由:文章系统梳理了 RLHF、IFT、SFT、CoT 等技术如何让对话智能体有用,并对比主流模型差异。

1月3日周二
  1. Hugging Face Blog34

    图机器学习入门

    Hugging Face 发布图机器学习入门教程,讲解图的基本概念、表示方法及应用任务,涵盖图级、节点级、边级和子图级任务,如 AlphaFold 的节点属性预测和推荐系统中的缺失边预测。文章依次介绍从前神经网络方法到图神经网络(GNN)的学习方式,并简要探讨面向图的 Transformer,聚焦同质图,区分 transductive 与 inductive 两种设置。

9月26日周一
  1. Hugging Face Blog68

    Hugging Face 与 Intel Labs、UKP Lab 发布少样本分类框架 SetFit

    Hugging Face 联合 Intel Labs 和 UKP Lab 发布 SetFit,一个无需提示词的少样本文本分类框架。每类仅需 8 个标注样本即可在 Customer Reviews 数据集上媲美用全量 3k 样本微调的 RoBERTa Large;在 RAFT 基准上 355M 参数的 SetFit 超过 PET 和 GPT-3。

    推荐理由:官方详解 SetFit 的原理、训练成本和 RAFT 实测数据,并附可复现的训练代码,方便直接上手做少样本分类。

5月4日周三
3月28日周一
2月2日周三
10月29日周五
6月3日周四
3月9日周二