OpenAI 用 GPT-4 自动解释大语言模型中的神经元并发布 GPT-2 数据集
OpenAI 使用 GPT-4 自动为大语言模型中神经元的行为撰写解释并进行评分,并发布了涵盖 GPT-2 每个神经元的解释与评分数据集。OpenAI 说明这些解释并不完美。
推荐理由:OpenAI 用 GPT-4 自动解释并评分 GPT-2 神经元行为并开源数据,为可解释性研究提供了可复用的方法思路。
OpenAI 使用 GPT-4 自动为大语言模型中神经元的行为撰写解释并进行评分,并发布了涵盖 GPT-2 每个神经元的解释与评分数据集。OpenAI 说明这些解释并不完美。
推荐理由:OpenAI 用 GPT-4 自动解释并评分 GPT-2 神经元行为并开源数据,为可解释性研究提供了可复用的方法思路。
Hugging Face 团队将 BigCode 的 StarCoder(16B 参数、8,192 token 上下文)微调为编程助手 StarChat alpha。
推荐理由:原文完整展示了用 OpenAssistant 对话数据和 DeepSpeed ZeRO-3 将 StarCoder 微调为编程助手的可复现流程,并附评估方法。
Hugging Face 发布博客,梳理文本生成视频模型从 GAN、Transformer 到扩散模型的演进脉络,并对比文本生成图像任务解释其在计算成本、数据集和视频描述上的挑战。
推荐理由:系统梳理了文本生成视频模型的技术演进、数据集挑战与代表工作,并给出 Diffusers 上的可复用代码与演示入口。
BigCode(由 Hugging Face 与 ServiceNow 联合主导)发布约 15B 参数的代码大模型 StarCoder 和 StarCoderBase,在 1 万亿 token 上训练,覆盖 80+ 编程语言。
推荐理由:官方发布且附完整评测数据,读者可以据此对比开源代码模型与闭源模型的实际差距。
Hugging Face Unity API 是对 Hugging Face Inference API 的易用集成,可在 Unity 项目中调用 Hugging Face 模型。
Hugging Face 发布端到端教程,演示用 TensorFlow 和 TPU 在 WikiText (v1) 数据集上从零训练 RoBERTa base 模型,涵盖训练 Unigram tokenizer、生成 TFRecord 分片上传 GCS、以及用 TPUStrategy 进行数据并行训练。
推荐理由:原文给出从 tokenizer 训练到 TPU 训练的完整流程与代码,读者可据此把 TensorFlow 训练管线迁移到 TPU。
Hugging Face 官方博客演示用 🧨 diffusers 在免费版 Google Colab(13GB CPU 内存、T4 15GB 显存)上运行 DeepFloyd 的开源文生图模型 IF,并支持图像变化和局部重绘。
推荐理由:官方博客给出在 13GB 内存免费 Colab 上跑通 40GB 参数 IF 的完整低显存方案,含可复用的代码和量化技巧。
Databricks 向 Hugging Face 代码库提交首个官方贡献:Datasets 新增 from_spark 函数,可将 Apache Spark dataframe 直接转为 Hugging Face Dataset,免去先写 Parquet 再重新加载的繁琐流程。16GB 数据集的处理时间从 22 分钟降至 12 分钟,缩短超过 40%。
OpenAI 为 ChatGPT 推出新的数据管理方式,用户现在可以关闭聊天记录,并自行选择哪些对话可用于训练 OpenAI 的模型。
Hugging Face 推出面向中文读者的中文博客(hf.co/blog/zh),由志愿者团队翻译博客文章及 Transformer、扩散模型、强化学习等课程,服务不断壮大的中文 AI 社区。
Hugging Face Spaces 除了用于机器学习 demo,也可以托管可玩的 Unity 游戏。教程共 11 步:用 Static HTML 模板创建 Space 并用 Git 克隆,将 Unity 项目 Build Target 切换为 WebGL,压缩格式设为 Disabled,构建后把文件复制到仓库,用 Git-LFS 跟踪 Build/* 大文件后推送即可。
Hugging Face 与 AWS 合作,针对 AWS Inferentia2 推理加速器优化 Hugging Face Transformers,通过 optimum neuron 只需一行代码即可编译模型。
Hugging Face 发布教程,讲解如何用 Transformers 库(版本 >= 4.27.2)和 Microsoft 的 Graphormer 进行图分类。
Hugging Face 与开源联邦学习框架 Substra 合作创建了一个 Space,演示如何在数据不出本地的前提下训练模型。联邦学习只传输模型权重,多来源数据训练的模型在验证数据上几乎总优于单一来源模型。Substra 已在乳腺癌研究等真实场景落地,并曾支撑 MELLODDY 项目中 10 家药企共享全球最大的小分子活性数据集。
OpenAI 宣布推出 Bug Bounty 漏洞赏金计划,邀请外部人员帮助发现其技术与服务的安全漏洞。OpenAI 表示该举措是其开发安全、可靠、可信的先进 AI 承诺的重要一环。
Snorkel AI 与 Hugging Face 合作,将 Hugging Face 平台上超过 150,000 个开源模型接入 Snorkel Flow 开发平台,帮助企业针对自身用例适配基础模型。
OpenAI 阐述其 AI 安全方法,强调安全地构建、部署和使用 AI 系统对实现其使命至关重要。原文仅简要表态,未提及具体模型、版本或技术细节。
Hugging Face 发布 StackLLaMA 模型及完整 RLHF 训练教程,演示如何将 LLaMA 7B 微调用于回答 Stack Exchange 问答。
推荐理由:Hugging Face 官方复盘 StackLLaMA 全流程训练细节,包括显存估算、LoRA 配置和 RLHF 训练中的稳定性坑,方法可直接迁移复用。
Hugging Face 阐述其在开放机器学习中的伦理实践:通过逐案分析风险、识别高风险模型,在开放开发与风险控制之间寻求平衡。平台已推出 flagging 举报功能、模型卡文档、“Not For All Audiences” 标签,并推广 RAIL 开放责任许可(如 BLOOM、BigCode),同时基于社区 Spaces 总结出 6 个伦理分类标签。
Hugging Face 发布教程,演示多种技术在 Sapphire Rapids CPU 上加速 Stable Diffusion 推理。
Hugging Face 展示了如何用 Optimum Habana 在 Habana Gaudi2 上部署 1760 亿参数的 BLOOMZ。基准测试中,Gaudi2 生成 100 个 token 的延迟为 3.103 秒,比 A100 80GB 快 1.42 倍;BLOOMZ-7B 则快 2.89 倍。
这是一篇教程,讲解如何用 Flower 框架结合 Hugging Face,在多个客户端上对预训练模型 distilBERT 做联邦微调,完成 IMDB 影评正负情感分类任务。各客户端在本地训练模型并只上传参数,由服务器按预定义策略聚合,无需共享数据。教程还提供可在 Google Colab 中用 flwr['simulation'] 模拟联邦环境的 notebook。
OpenAI 发布 3 月 20 日 ChatGPT 故障的调查结果,说明了问题起因、已采取的补救措施,以及该 bug 的技术细节。
Hugging Face 发布教程,详解如何用 diffusers 训练 ControlNet,并以基于 Microsoft FaceSynthetics 10 万合成人脸数据集训练的 Uncanny Faces 面部姿态模型为例。
推荐理由:作者以亲身训练经历给出从数据集构建到训练参数的完整流程,还分享了过拟合教训和 8GB 显存的降配方法。
OpenAI 宣布在 ChatGPT 中实现插件的初步支持。插件是专为语言模型设计、以安全为核心原则的工具,可帮助 ChatGPT 获取最新信息、运行计算或使用第三方服务。
推荐理由:原文来自 OpenAI 官方,说明了插件的三类能力定位和安全原则,可帮助读者理解 ChatGPT 能力边界的扩展方向。
Hugging Face Hub 宣布改进 Jupyter notebook(.ipynb)托管支持,新增渲染功能,此前以 JSON 格式存储的 notebook 现在可直接以人类可读格式显示。
OpenAI 发布论文 GPTs are GPTs,初步评估大语言模型对美国劳动力市场的潜在影响。因抓取失败仅有标题,具体结论以原文为准。
OpenAI 发文介绍 Be My Eyes 应用使用 GPT-4 改善视觉无障碍体验。正文仅给出核心信息,未提供更多细节。
Stripe 使用 GPT-4 来简化用户体验并打击欺诈行为。
冰岛正使用 OpenAI 的 GPT-4 来保护冰岛语。这一合作旨在让这门使用人数较少的语言在 AI 时代得以传承和延续。
Khan Academy 通过一个有限的试点项目探索 GPT-4 在教育领域的应用潜力,将 GPT-4 引入虚拟课堂教学场景。
OpenAI 的 GPT-4 被 Duolingo 用于深化其语言学习对话体验。借助 GPT-4,Duolingo 弥补了语言学习中的关键缺口,为学习者提供更深入的对话练习。
OpenAI 发布 GPT-4,称其为扩大深度学习规模的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入、输出文本;虽然许多真实场景下仍不及人类,但在多项专业和学术基准上表现出人类水平性能。
推荐理由:官方原文明确 GPT-4 接受图像和文本输入,并在多项专业与学术基准上达到人类水平表现,可据此了解其能力定位。
OpenAI 发布 GPT-4。该模型可在创意和技术写作任务上生成、编辑并与用户迭代,例如创作歌曲、撰写剧本或学习用户的写作风格。
推荐理由:官方宣布 GPT-4 发布,说明其在创意与技术写作任务上的生成、编辑和迭代能力,可作为了解该模型基础能力的入口。
Hugging Face 宣布 Informer 模型已在 🤗 Transformers 库中可用,并演示如何用它做多变量概率时间序列预测。
Hugging Face 官方发布 trl 与 peft 的集成,让用户能以更低成本用强化学习微调大语言模型。通过 8-bit 加载(LLM.int8)、低秩适配器以及用 disable_adapters 复用同一模型获取参考与主动 logits,作者在 24GB NVIDIA 4090 上验证了微调 20B gpt-neox 生成正面影评的完整流程,并指出训练速度和多卡扩展是下一步方向。
推荐理由:原文给出 trl 与 peft 集成的完整微调流程和显存拆解,读者可以照此在单张 24GB GPU 上复现大模型 RLHF 训练。
Kakao Brain 与 Hugging Face 发布开源图像文本数据集 COYO-700M,以及基于它训练的 ViT 和 ALIGN 模型,其中 ALIGN 为首个开源版本。
Hugging Face 发布教程,介绍如何在 Diffusers 中通过 StableDiffusionControlNetPipeline 使用 ControlNet,支持 canny 边缘、OpenPose 姿态等 8 种空间条件控制 Stable Diffusion 生成,并可组合多个条件或与 DreamBooth 微调结合。
推荐理由:原文给出 ControlNet 在 Diffusers 中的完整用法和加速省显存配置,读者可以照搬代码在 Colab 上复现同样的生成效果。
Hugging Face 博客复盘志愿者团队在 2023 年 2 月土耳其地震后开发 afetharita 应用的过程:用 easyocr 加微调 NER 模型从求助推文截图提取姓名、电话和地址,用 bert-base-turkish 系列微调文本分类模型识别庇护、食物、物流等需求,并将地址经地理编码 API 显示在地图上。
Hugging Face 为 Diffusers 库发布伦理框架,以透明、一致、简洁、可及、可复现、责任六项价值观指导维护者对社区贡献的技术决策。
最多提供 50 页,更早的内容请使用搜索或主题页。