Hugging Face 深度强化学习课程第 8 单元讲解 PPO 原理与实现
Hugging Face 深度强化学习课程第 8 单元讲解 Proximal Policy Optimization(PPO),核心是通过比率裁剪将策略更新限制在 [1−ϵ,1+ϵ] 区间以提升训练稳定性。
Hugging Face 深度强化学习课程第 8 单元讲解 Proximal Policy Optimization(PPO),核心是通过比率裁剪将策略更新限制在 [1−ϵ,1+ϵ] 区间以提升训练稳定性。
Hugging Face 推出 Private Hub(PH),为从研究到生产的机器学习全流程提供一套安全合规的统一工具。
Nyströmformer 借助 Nyström 矩阵近似方法,将标准自注意力的 O(n²) 时间与内存复杂度降至 O(n)。由于无法直接对 softmax 矩阵采样,该方法从 queries 和 keys 中以 segment means 构建地标点来近似 softmax 矩阵,并配合 1D depthwise convolution 的 skip connection。
Hugging Face 于 2022 年 6 月底向白宫科技政策办公室和 NSF 提交了对 NAIRR 中期报告的意见。Hugging Face 建议任命技术与伦理专家为顾问、制定模型和数据文档标准(如 Model Cards)、提供低代码工具(如 AutoTrain)降低跨学科使用门槛,并监控开源资源的滥用风险。
Hugging Face 为 🤗 Datasets 库新增音频与图像数据集的文档,包括更新后的 Quickstart 和按模态划分的专属指南。Quickstart 提供 PyTorch 或 TensorFlow 的端到端加载与处理示例,并引入 to_tf_dataset 函数将数据集转换为 tf.data.Dataset。
Hugging Face 宣布 🤗 transformers 的 TensorFlow 文本生成支持 XLA 编译,部分场景提速超过 100 倍,多数情况下甚至快过 PyTorch 最高 9 倍。
推荐理由:官方详解 TensorFlow 文本生成用 XLA 加速的用法与坑,给出 padding 控制形状和一行代码启用的可复用方法。
Hugging Face 团队发布教程,讲解如何用 TensorFlow Serving 在本地部署 Transformers 中的 TensorFlow 视觉模型,示例为 google/vit-base-patch16-224 图像分类模型。
Hugging Face 深度强化学习课程第 7 单元讲解 Advantage Actor Critic (A2C)。文章指出 Reinforce 因使用 Monte-Carlo 采样估计回报导致策略梯度方差高、训练慢,而 Actor-Critic 架构结合 Actor(策略)与 Critic(价值函数)可降低方差。
Hugging Face 博客讲解动态对抗性数据收集(DADC):让人类构造样本来欺骗 SOTA 模型,再用这些数据多轮迭代训练以提升模型鲁棒性。文章以 MNIST 手写数字识别为例,展示了在 🤗 Spaces 上搭建模型交互 demo、标记(flag)对抗样本并重复训练的完整流程,作者训练的模型 20 epochs 后在测试集达到 89% 准确率。
Hugging Face 详细复盘 176B 参数模型 BLOOM 的训练技术,项目使用 384 张 80GB A100 GPU、350B token 的 59 语言数据集,耗时约 3.5 个月(约 100 万计算小时)。
作者详解了如何用 Sentence Transformers 和 Gradio 构建播放列表生成器:使用 msmarco-MiniLM-L-6-v3 模型(最大序列长度 512 word pieces)将歌词按段落切分后生成嵌入向量,再通过 util.semantic_search 对文本提示做语义搜索。
BigScience 项目发布开源多语言大模型 BLOOM,1760 亿参数,可生成 46 种自然语言和 13 种编程语言的文本。训练历时 117 天,在法国 Jean Zay 超算上完成,涉及 70 多国 250 多个机构的 1000 多名研究者。
推荐理由:大语言模型开源和透明训练的代表性案例,说明了开放协作如何让百亿级参数模型走向可研究、可复用。
Hugging Face 发布 Twitter 情感分析入门指南,介绍如何用机器学习自动判断推文的正面、负面或中性倾向,用于分析用户反馈和监测品牌提及。有代码基础的读者可用 Tweepy 获取推文并通过 Inference API 做分析,不会编程的用户则可用 Zapier 无代码完成收集、分析和结果写入 Google Sheets 的流程。
Hugging Face 深度强化学习课程第 5 单元讲解首个策略梯度方法 Reinforce(Monte Carlo Policy Gradient),并用 PyTorch 从零实现。
Hugging Face 发文介绍机器学习新手如何借助 Sentence Transformers 完成第一个自驱项目。该库可将句子和图像转为嵌入向量,通过 util.cos_sim 余弦相似度比较句子并实现语义搜索,可延伸至聚类、模型蒸馏和 CLIP 文生图,在 GitHub 上已有近 8,000 stars、超过 3,000 个项目依赖它。
Hugging Face 发布教程,讲解如何通过 Accelerate 使用 DeepSpeed ZeRO 特性训练大模型,无需修改代码即可启用 ZeRO Stage-2。
Hugging Face 推出 Evaluation on the Hub,由 AutoTrain 驱动,无需写任何代码即可在 Hub 上用任意数据集和指标评估任意模型。团队已评估数百个模型,并通过 Pull Request 将验证结果写入模型卡元数据。提交界面和排行榜基于 Hugging Face Spaces 构建,支持为任务找最佳模型、在新数据集上跑基线等场景。
Hugging Face 发布 embeddings 入门教程,讲解如何用开源库 Sentence Transformers 的 "sentence-transformers/all-MiniLM-L6-v2" 模型生成文本嵌入向量,并通过 Inference API 构建 FAQ 语义搜索引擎。
Hugging Face 介绍了三种把 Transformers 模型导出为 ONNX 的方法,并以文本分类模型 distilbert-base-uncased-finetuned-sst-2-english 为例演示。
Intel 正式加入 Hugging Face 的 Hardware Partner Program,双方将基于开源库 Optimum Intel 为 Transformer 的训练、微调和推理构建硬件加速。
Hugging Face 深度强化学习课程第 3 单元讲解 Deep Q-Learning:用神经网络替代 Q-table 来近似 Q 值,解决 Q-Learning 无法应对 Space Invaders 这类 256^100800 巨大状态空间的问题。
Hugging Face 发布教程,基于 Ho et al. 2020 的 DDPM 论文和 Phil Wang 的实现,用 PyTorch 逐步实现扩散模型。
推荐理由:逐行实现 Ho et al. 2020 的 DDPM,覆盖前向加噪、损失推导、U-Net 结构与采样训练全流程,便于动手理解扩散模型原理。
Graphcore 与 Hugging Face 扩展开源库 Hugging Face Optimum,为 Graphcore IPU 优化的 Transformer 模型现已覆盖 NLP、语音和计算机视觉,共 10 个模型,附 IPU 配置文件和即用的预训练与微调权重。
Hugging Face 宣布在 Hub 上线 pull requests 和 discussions 功能,所有模型、数据集和 Spaces 仓库的 Community 标签页均可用。任何社区成员都能参与讨论和贡献,PR 不使用 fork,而是把自定义 ref 分支直接存放在源仓库,整体比 GitHub 的 PR 和 Issues 更简化,面向 ML 仓库场景优化。
推荐理由:官方介绍 Hub 新增 pull requests 和 discussions 的用法与底层机制,读者可了解其与 GitHub PR 的差异及协作方式。
Hugging Face 深度强化学习课程 Unit 2 第二部分讲解 Q-Learning 算法,并指导从零实现第一个 RL 智能体。该 off-policy 的 value-based 方法基于 TD 方式更新 Q-table,使用 Epsilon Greedy 策略平衡探索与利用。
Sempre Health 借助 Hugging Face 的 Expert Acceleration Program 构建了自动分类和回复患者短信的 NLP 管线,上线后约 20% 的入站消息可被系统自动处理。此前的规则系统只能覆盖 80% 的入站短信,Hugging Face 团队在标注、模型选型和方法上提供了指导,降低了运营团队的低价值工作量。
Hugging Face 多模态学习小组发布了一份伦理章程,将伦理原则作为机器学习研究生命周期的核心,并由伦理落地、数据治理与个人隐私领域专家参与撰写。章程明确了希望防止的滥用场景,包括生成可识别个人身份的信息、针对性别的偏见、在医疗和法律等高风险领域的鲁莽使用等。团队同时承诺保持透明、开放可复现、公平和自我批判,并承认部分价值观之间可能存在冲突,需逐案权衡风险与收益。
Hugging Face 深度强化学习课程 Unit 2 第一部分讲解基于价值的方法,涵盖 State-Value 函数、Action-Value 函数、Bellman 方程,以及 Monte Carlo 与 Temporal Difference Learning 的区别。
Hugging Face 研究科学家 Sasha Luccioni 在 Machine Learning Experts 节目中分享她的职业经历与研究方向。
Hugging Face 推出开源机器学习贡献者网络,为 Fellows 提供算力资源、周边礼品和官方认可等支持。首批 Fellow 包括向 Hub 贡献 300 多个模型的 Manuel Romero、创建最大西班牙语 NLP 社区的 María Grandury 等。
Hugging Face 发布 Gradio 3.0,这是 Gradio 库的全面重设计。新版本基于 Svelte 重建前端,页面加载更快、载荷更小,改进了 Dataframe 等组件并新增 Gallery、TabbedInterface;同时推出底层 Blocks API,支持自定义布局、多步数据流和根据用户输入改变组件属性或可见性。
推荐理由:官方介绍了 Gradio 3.0 的前端重设计和新 Blocks API 能力,想用 Python 构建自定义 ML 演示界面的读者可以了解能做什么。
Hugging Face 首次推出 Student Ambassador Program,面向在校生招募大使,支持其在校内社区推广开源机器学习,目标是到 2023 年教会 500 万人 ML。
Hugging Face 采访 Salesforce 和 Amplitude 等公司的机器学习总监,探讨 ML 对 SaaS 的影响与挑战。受访的 Omar Rahman 在 Salesforce 网络安全团队利用 ML 做防御性安全,Cao (Danica) Xiao 领导 Amplitude 的数据科学与机器学习团队。
Hugging Face 发布 Optimum 1.2,为 Transformers pipelines 增加 ONNX Runtime 推理支持,用户只需将 AutoModelForXxx 替换为 ORTModelForXxx 即可使用相同 API。
Hugging Face 宣布完成 1 亿美元 C 轮融资,由 Lux Capital 领投,Sequoia、Coatue 等参投。平台已托管 10 万个预训练模型和 1 万个数据集,超过 1 万家公司在使用,团队过去 12 个月从 30 人扩至 120 多人,新资金将投入研究、开源产品和负责任的 AI 普及。
推荐理由:官方公告给出了融资规模、领投方与平台最新规模数据,可了解开源机器学习生态的资本动向。
fastai 用户现可通过一行 Python 代码将模型上传到 Hugging Face Hub。fastai 是基于 PyTorch 的开源深度学习库,支持文本、视觉和表格数据的先进模型训练。
Hugging Face 推出免费的深度强化学习课程(Deep Reinforcement Learning Class),第一章讲解 RL 基础理论,包括 RL 流程、reward hypothesis、Markov 性质、策略与价值方法等核心概念。
Hugging Face 发文介绍如何在 Accelerate 库中使用 PyTorch FullyShardedDataParallel(FSDP),无需改动代码即可分片训练大模型。
这是一篇教程,讲解如何用 HuggingFace AutoTrain 和 Kili 搭建文本分类的主动学习流程。文章以 Google Play Store 上约 40130 条 Medium 应用评论为数据集,定义了订阅、内容、界面、用户体验 4 个分类,并对评论做情感分析。
Hugging Face 实战演示如何在 AWS EC2 DL1 实例(配备 8 个 Habana Gaudi 处理器)上微调 BERT:使用 Habana Deep Learning AMI 和 PyTorch 容器。