跳到正文

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

最新精选

第 1–20 条 · 共 40 条
10月1日周四
9月29日周二
  1. Hugging Face Blog60

    NVIDIA 开源表格基础模型 Kumo Tabular,单次前向预测登顶四大基准

    NVIDIA 发布开源表格基础模型 Kumo Tabular,对带标签的表格数据在单次前向传播中完成分类或回归预测,无需训练、调参或特征工程。

    推荐理由:官方发布开放表格基础模型,用上下文学习免训练预测,作者给出了架构细节和基准表现,读者可以评估它是否适合替换现有梯度提升树流程。

9月10日周四
  1. Hugging Face Blog63

    Hugging Face 实践:用 Storage Bucket 和代理跨 HF Jobs 跑 Async GRPO + LoRA,无需 NCCL

    Hugging Face 博客介绍 TRL v1.14 的 AsyncGRPOTrainer 支持 LoRA 训练并仅向 vLLM 同步几 MB 的 adapter,训练与推理以独立 HF Jobs 运行,通过 Storage Bucket 挂载共享 adapter,前置代理负责加鉴权头、按 KV 前缀路由 rollout 并向所有副本广播 adapter 加载。

    推荐理由:原文给出了跨机 LoRA GRPO 的完整架构与五轮瓶颈调优数据,500 步从 3 小时 27 分压到 53 分钟,方法可直接复用。

9月3日周四
  1. Hugging Face Blog62

    Hugging Face 用 100 步 GRPO 微调 LFM2.5-350M,IFStruct 成绩从 22.6% 提升至 29.7%

    Hugging Face 发布教程,展示用 TRL 库以 GRPO 微调 LiquidAI/LFM2.5-350M 提升结构化输出合规率。训练仅用约 500 样本和 100 步,可在免费版 Colab 或 Kaggle GPU 上运行,评测经 llama.cpp 在 MacBook 本地完成。

    推荐理由:原文给出完整可复现的 GRPO 微调流程和量化前后对比,读者可以用同样低成本方法提升小模型的结构化输出合规率。

8月28日周五
  1. Hugging Face Blog60

    Open ASR Leaderboard 新增 Monsoon 印地语与印度英语评测集

    Voice Arena 与 Hugging Face 合作,在 Open ASR Leaderboard 引入 Monsoon en-IN 和 Monsoon hi-IN 两套评测集,覆盖 4,888 名说话人,印地语是该多语言榜单上首个非欧洲语言。

    推荐理由:原文给出 Monsoon 四个评测集的采集设计与区域误差分析样例,读者可以了解带说话人元数据的 ASR 评测能揭示什么。

6月30日周二
  1. Google Research63

    Google 发布表格数据零样本基础模型 TabFM

    Google Research 发布面向表格数据分类与回归的零样本基础模型 TabFM,将表格预测重构为上下文学习问题,免去人工训练、调参和特征工程。

    推荐理由:官方介绍了把表格预测重构为上下文学习问题的模型设计、合成数据训练方式和 TabArena 基准结果,读者可据此评估其对传统表格机器学习流程的影响。

6月18日周四
  1. Hugging Face Blog66

    Hugging Face 实测多款 PEFT 技术:LoRA 表现良好但未必是最佳选择

    Hugging Face 在 PEFT 库中 added LLM 数学微调和图像生成两个基准,用相同模型、数据、代码和硬件对比 40 多种 PEFT 技术,并追踪 VRAM、遗忘、运行时间和 checkpoint 大小等指标。

    推荐理由:Hugging Face 用统一条件的基准实测多种 PEFT 技术,给出 LoRA 并非处处最优的证据和其他技术在两个任务上的具体取舍数据。

6月5日周五
  1. Google Research67

    Google 发布 PHRM 系统,用手机前摄在日常使用中被动监测心率与静息心率

    Google 在 Nature 发表 PHRM 研究系统,利用人脸解锁后的前摄视频,通过深度学习在后台估计心率,相比 ECG 的 MAPE 为 6.09%,日静息心率相对 Fitbit Charge 6 的 MAE 为 4.39 bpm。研究覆盖近 700 名不同肤色参与者,是迄今最大规模的 rPPG 研究,并公开发布数据集与预训练 PHRM-mini 模型供合格研究者申请使用。

    推荐理由:原文给出跨肤色验证数据与免费开放的数据集和模型入口,研究者可以据此评估rPPG方法的可复用性。

5月19日周二
  1. Hugging Face Blog66

    Hugging Face 发布 Ettin Reranker 系列:6 个 Apache 2.0 交叉编码器重排序模型

    Hugging Face 的 Tom Aarsen 发布 ettin-reranker-v1 系列,含 17M 到 1B 六个 Sentence Transformers CrossEncoder 重排序模型,基于 Ettin ModernBERT 编码器,Apache 2.0 许可,支持最长 8192 token 上下文。

    推荐理由:作者公开了六个模型、完整训练脚本和1.43亿条蒸馏数据,并给出与主流reranker的速度和精度对比,便于按规模选型或自行复现训练。

4月29日周三
  1. Hugging Face Blog64

    IBM Granite 4.1 系列模型发布并详解训练过程

    IBM Granite 团队发布 Granite 4.1 系列 dense 模型,含 3B、8B、30B 三个规模,在约 15T tokens 上训练,上下文经长文本扩展达 512K,均以 Apache 2.0 许可开源。

    推荐理由:原文完整披露了五阶段预训练、SFT 质控和四阶段 RL 的训练配方,8B 稠密模型对标上一代 32B-A9B MoE 的结果也可供选型参考。

4月1日周三
  1. Hugging Face Blog62

    TII 发布 Falcon Perception 0.6B 早融合感知模型及 0.3B Falcon OCR

    TII Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早融合 Transformer,用混合注意力掩码处理图像块与文本,做自然语言提示的开放词汇定位与分割,在 SA-Co 上达到 68.0 Macro-F1(SAM 3 为 62.3),但在 presence calibration 上落后(MCC 0.64 vs 0.82)。

    推荐理由:TII 自述用单一早融合 Transformer 做开放词汇感知,读者可以看到架构、数据配方和 SA-Co 与 PBench 上的具体对比依据。

3月21日周六
3月18日周三
2月20日周五
  1. Hugging Face Blog66

    Hugging Face 教程:用 Unsloth 和 HF Jobs 通过 Claude Code 等编码智能体免费微调 LFM2.5-1.2B-Instruct

    Hugging Face 发布教程,讲解如何用编码智能体(Claude Code、Codex、Open Code)配合 Unsloth 在 HF Jobs 上微调 LiquidAI/LFM2.5-1.2B-Instruct。

    推荐理由:官方教程给出用编码智能体加 Unsloth 在 HF Jobs 上微调小模型的完整流程,含脚本、命令和各尺寸 GPU 的每小时成本参考。

1月28日周三
  1. Google Research68

    Google Research 发布 ATLAS 多语言模型缩放定律,将亮相 ICLR 2026

    Google Research 发布 ATLAS(Adaptive Transfer Scaling Laws),迄今最大规模公开多语言预训练研究,覆盖 774 次训练、10M–8B 参数模型、400+ 语言数据和 48 语言评测。

    推荐理由:原文给出多语言训练的跨语言迁移矩阵和预训练与微调的token分界点,开发者可据此规划语言混合与算力预算。

11月8日周六
  1. Google Research60

    Google Research 提出嵌套学习范式并发布 Hope 架构应对持续学习

    Google Research 在 NeurIPS 2025 发表 Nested Learning 论文,将机器学习模型视为多层嵌套的优化问题,统一模型架构与优化算法两个层面。

    推荐理由:原文提出把模型架构与优化算法统一为嵌套优化问题的新范式,并给出 Hope 架构的实验验证,对持续学习方向有方法层面的参考价值。

10月27日周一
9月10日周三
  1. Hugging Face Blog64

    Hugging Face 发布 Jupyter Agent:微调 Qwen3-4B 提升 DABStep 数据科学任务表现

    Hugging Face 发布 Jupyter Agent 项目,用约 2TB Kaggle 笔记本构建 51k 条合成轨迹、近 0.2B tokens 的数据集,微调 Qwen3-4B-Instruct-2507 与 Qwen3-4B-Thinking-2507。

    推荐理由:原文完整给出从数据清洗到微调的管线与消融数字,读者可复用其中提升小模型数据科学能力的做法。

8月8日周五
  1. Hugging Face Blog71

    Hugging Face 开源 AI Sheets:用开放模型无代码构建和增强数据集

    Hugging Face 发布开源无代码工具 AI Sheets,用于以电子表格方式构建、转换和增强数据集,可本地部署或在 Hub 上免费试用,支持通过 Inference Providers 调用 Hub 上数千个开放模型(含 OpenAI 的 gpt-oss)。

    推荐理由:官方发布的无代码数据处理工具,原文说明了用提示词建列、few-shot 反馈和 LLM 评审等玩法,读者可判断是否引入自己的数据流程。

7月29日周二