Hugging Face 推出 Open Arabic LLM Leaderboard 阿拉伯语大模型排行榜
Hugging Face 与 TII 推出 Open Arabic LLM Leaderboard(OALL),为阿拉伯语大模型提供专门的评测与比较平台,服务全球超 3.8 亿阿拉伯语使用者。
Hugging Face 与 TII 推出 Open Arabic LLM Leaderboard(OALL),为阿拉伯语大模型提供专门的评测与比较平台,服务全球超 3.8 亿阿拉伯语使用者。
Hugging Face 发布 Transformers Agents 2.0,新增可基于过往观察迭代的 ReactCodeAgent 与 ReactJsonAgent,并支持社区智能体分享。
推荐理由:官方详解新 Agent 框架的设计原则与多智能体用例,并给出基准结果,开源模型表现可作选型参考。
Hugging Face 推出专门评估希伯来语大语言模型的开放排行榜,包含四个基准:希伯来语问答(HeQ 数据集)、情感分析、Winograd Schema 指代消解和英希翻译,均采用 few-shot 提示格式评测。
Hugging Face 团队发布 StarCoder2-15B-Instruct-v0.1,首个采用完全透明、许可开放管线的自对齐代码 LLM,无需人工标注或从专有大模型蒸馏数据。
Hugging Face 发布 JAT,一个基于 Transformer 的多用途智能体项目,包含 Gato 的开放复现:发布了覆盖 Atari、BabyAI、Meta-World、MuJoCo 等环境的大量专家 RL 智能体、首个通用智能体训练数据集 JAT dataset(含数十万条专家轨迹)以及可玩电子游戏、控制机器人、执行导航指令的 JAT 模型。
Meta 发布 Llama 3 开源模型,提供 8B 和 70B 两种规模,各有 base 与 instruct 版本,并附基于 Llama 3 8B 微调的 Llama Guard 2,全部上架 Hugging Face Hub。
推荐理由:官方发布说明完整给出模型规格、许可证变化和部署微调路径,读者可据此评估升级与迁移成本。
Mistral AI 开源发布 Mixtral 8x22B,采用 Apache 2.0 许可证。该稀疏 MoE 模型总参数 141B、激活参数仅 39B,支持英语、法语、意大利语、德语和西班牙语,具备函数调用能力与 64K tokens 上下文窗口,官方称其速度快于任何稠密 70B 模型。
推荐理由:官方给出了参数结构、许可证和基准成绩,读者可据此评估它在大模型开源阵营中的性价比和适用场景。
Hugging Face 博客介绍 Gradio 的 reload 模式,用 gradio app.py 代替 python app.py 启动即可在不重启服务器的情况下载入最新代码改动。
Zama 团队将其基于全同态加密(FHE)的隐私保护机器学习框架 Concrete ML 的预编译模型上线 Hugging Face Endpoints,用户可一键部署 FHE 友好模型(如加密垃圾邮件检测的决策树)并在加密数据上直接推理。
Hugging Face 发布通用多模态模型 Idefics2,参数量 8B,权重以 Apache 2.0 许可开源,支持任意图文序列输入,可回答图像问题、描述视觉内容、从文档提取信息和执行基础算术。
推荐理由:官方发布 8B 开源多模态模型并给出基准对比和训练数据,读者可以直接在 Hub 和 transformers 中上手微调。
Hugging Face 宣布在 Hub 上推出 Deploy on Google Cloud 集成,可将数千个基础模型通过 Vertex AI 或 GKE 部署到用户自己的 Google Cloud 账户中。
Google 与 Hugging Face 合作发布 CodeGemma,包含专注代码填充的 2B 基座、混合代码与自然语言的 7B 基座,以及 7B Instruct 对话版本,均支持 8K 上下文。
推荐理由:原文给出三个模型规格、基准对比与 FIM 提示词格式,读者可以据此选择适合延迟、显存或对话场景的版本。
Hugging Face 宣布与云安全公司 Wiz 合作,已集成 Wiz 用于漏洞管理和云安全态势管理,并自动修复 Spaces 中的问题。Wiz 研究人员通过 pickle 发现其沙箱计算环境的缺陷,相关漏洞已全部修复。官方建议用户在生产环境弃用 pickle、改用 Safetensors,并警告 pickle 未来可能不再受支持。
DuckDB-NSQL-7B 是 MotherDuck 和 Numbers Station 专为 DuckDB SQL 推出的 text2SQL 模型,基于 Meta 的 Llama-2-7b 微调,可生成包括 SELECT 在内的多种有效 DuckDB SQL 语句。
Hugging Face Hub 推出 Deploy on Cloudflare Workers AI 集成,将 Llama 2 7B、Gemma、Mistral 等热门开源模型以 serverless API 形式部署在 Cloudflare 边缘数据中心的 GPU 上,采用按请求付费模式。
开源人形机器人 Reachy 的开发商 Pollen Robotics 发布开源库 pollen-vision,提供面向机器人的零样本视觉模型统一接口,无需训练即可开箱使用。
Hugging Face 博客介绍 embedding 量化方法,展示二值量化可将内存与磁盘占用降至 1/32、检索最快提速 45x,配合 rescoring 可保留约 96% 的检索性能;int8 标量量化占用为 1/4、平均提速 3.66x。
推荐理由:原文给出 embedding 量化的原理、代码与实测数据,读者可以照此在检索场景中权衡内存、速度与精度。
Hugging Face 发布面向非技术读者的 Transformers 入门教程,手把手演示如何在 Hugging Face Space 的 JupyterLab notebook 中运行微软的 Phi-2 大语言模型。
Hugging Face 官方博客介绍 GaLore 如何利用梯度低秩结构降低训练内存,支持在 RTX 4090 等消费级 GPU 上预训练 Llama 架构 7B 模型。优化器状态内存可减少超过 82.5%,可与 8-bit 优化器结合,并支持通过 transformers>=4.39.0 和 galore-torch 使用 galore_adamw 等优化器及 _layerwise 逐层更新。
推荐理由:原文给出GaLore在消费级硬件上预训练7B模型的方法细节和Transformers接入方式,可迁移到实际训练工作流。
Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成数据集,含超 3000 万文件、250 亿 token,旨在复现 Phi-1.5 的训练数据。
推荐理由:官方详解大规模预训练合成数据的构建流程,提示词策划、聚类与去污染方法均可迁移到类似的数据生成项目。
Hugging Face 教你在搭载 Intel Core Ultra 7 155H 的笔记本上本地运行 Microsoft Phi-2:用 Optimum Intel 集成的 OpenVINO 对模型权重做 4-bit 量化(80% 权重 4-bit、其余 8-bit),在 Meteor Lake 的 iGPU 上推理。
Hugging Face 推出 quanto,一个面向 Optimum 的 PyTorch 量化后端,支持 int2/int4/int8 和 float8 权重、int8 和 float8 激活,可在 CUDA、MPS 等任意设备上运行。
推荐理由:原文给出 Quanto 的量化能力边界、完整工作流和 transformers 集成方式,读者可直接照此把 float 模型转到低精度部署。
Hugging Face 发布开源数据集 WebSight,用于训练视觉语言模型将网页截图转换为 HTML 代码。其最新版 WebSight-v0.2 扩展至 200 万个样本,改用真实图像和 Tailwind CSS。基于该数据集微调的模型 Sightseer 可将截图转为可运行的 HTML,并能在生成代码中嵌入与原图相近的图像。
Argilla 与 Hugging Face 发起 Data is better together 实验,几天内吸引 350 位社区贡献者,完成超过 11,000 次提示词评分,并发布含 10,000 条带评分提示词的数据集 10k_prompts_ranked。
BigCode 发布 StarCoder2 系列开放代码模型,含 3B、7B、15B 三个规模,均基于新数据集 The Stack v2 训练,并同步开放模型、数据集及处理与训练代码。
推荐理由:官方完整披露三个模型规模、训练数据与开放范围,读者可据此评估开源代码模型的可复用程度。
Hugging Face 推出 TTS Arena,一个让任何人对比并投票评选 TTS 模型的社区平台,借鉴 LMSys 的 Chatbot Arena 模式。
Hugging Face 发文介绍 Matryoshka 嵌入模型,这种模型可产出多种维度的有用嵌入,将重要信息前置以便截断后仍保持性能。
推荐理由:原文讲清 Matryoshka 嵌入的训练与使用方法,并用对比实验说明截断到 8.3% 维度仍保留 98.37% 性能,方法可直接复用。
Hugging Face 发布 Gemma 模型微调教程,演示用 Transformers、PEFT 与 trl 的 SFTTrainer,通过 LoRA 和 4-bit QLoRA(bitsandbytes、nf4 量化)在 google/gemma-2b 上以 english_quotes 数据集训练模型按指定格式输出名言和作者。
推荐理由:Hugging Face 官方用 LoRA 和 4-bit QLoRA 给出 Gemma 微调的完整可复现代码,覆盖 GPU 和 TPU 两种路径。
Google 发布开源大语言模型家族 Gemma,包含 2B 与 7B 两种规模、各有 base 与 instruction-tuned 共四个模型,基于 Gemini 技术并支持 8K 上下文。
推荐理由:官方博客给出四个开源模型的尺寸、性能对比和 Hugging Face 生态集成方式,读者可据此评估部署与微调路径。
Upstage 于 2023 年 9 月在 Hugging Face 上推出 Open Ko-LLM Leaderboard,构建韩语 LLM 评估生态。该排行榜采用 Ko-MMLU、Ko-ARC、Ko-HellaSwag、Ko-Truthful QA、Ko-CommonGEN V2 五项韩语基准,并采用不公开的私有测试集以防污染。
Hugging Face 在 PEFT 中为 LoRA adapter 新增多種合并方法,可通过 add_weighted_adapter() 调用,包括 cat、linear、svd、ties、dare_linear、dare_ties、magnitude_prune 及其 svd 变体。
推荐理由:官方详细介绍 PEFT 新增的多种 LoRA 合并方法及代码示例,还给出不同场景下的实测选择建议,便于直接复用。
Hugging Face 发布教程,展示用 Mixtral-8x7B-Instruct-v0.1 生成合成数据,再通过 AutoTrain 微调 RoBERTa-base 做金融新闻情绪分类。
推荐理由:原文给出可复用的合成数据蒸馏流程和成本对比数字,读者可以照此把自己的分类任务从 LLM API 迁到专用小模型。
AMD 与 Hugging Face 联合推出 Pervasive AI Developer Contest,向全球开发者免费提供 AMD 硬件用于构建 AI 应用。
SegMoE 框架正式发布,可将多个预训练扩散模型合并为混合专家模型,已集成 Hugging Face diffusers 并以 Apache 2.0 开源。发布 SegMoE-2x1、SegMoE-4x2 和 SegMoE-SD4x2 三个模型,用户只需编写 config.yaml 运行命令即可在几分钟内创建自己的 MoE 模型。
推荐理由:官方介绍了 SegMoE 的 MoE 架构、三个已发布模型和自制方法,读者可以据此尝试组合预训练扩散模型。
Hugging Face 发布了用开源模型实现 Anthropic Constitutional AI 的端到端配方,并开源了基于 TGI 和 vLLM、在 Slurm 集群上做规模化合成数据生成的工具 llm-swarm。
推荐理由:原文给出了开源模型跑通 Constitutional AI 的完整配方与实验数据,读者可以照着复现自己的对齐流程。
Patronus 团队基于 Hugging Face Leaderboard Template 推出 Enterprise Scenarios Leaderboard。
Hugging Face 推出开源的 Hallucinations Leaderboard,通过上下文学习(in-context learning)在多个幻觉相关基准上评估大语言模型的可靠性。
Hugging Face 宣布与 Google Cloud 建立战略合作伙伴关系,围绕开放科学、开源和云硬件展开合作。
推荐理由:来自当事方官方公告,讲清了合作的四个方向和具体落地场景,读者可了解 Hugging Face 模型在 Google Cloud 上的可用路径。
Hugging Face 讲解 ReAct 智能体原理,并发布 ChatHuggingFace 封装让开源模型接入 LangChain。评测显示 Mixtral-8x7B 在含 HotpotQA、GSM8K、GAIA 子集的基准上超越 GPT-3.5,Zephyr-7b-beta 和 Llama2-70b 表现较差;团队建议针对函数调用微调 Mixtral 以冲击 GPT-4。
IBM Research 与 Hugging Face 合作,将轻量级时间序列模型 PatchTSMixer 开源发布至 Transformers 库。