Hugging Face Blog·· 2025-07-08AI 评分55
Hugging Face 团队用背包算法优化多模态数据管线
Efficient MultiModal Data Pipeline
AI 导读
Hugging Face 团队在 nanoVLM 项目中发现训练慢的根源是数据管线浪费,朴素 padding 约浪费 60% 的 batch。文章分五阶段构建高效管线,用背包问题的 greedy 与 bin-packing 策略打包样本,兼顾 token 长度和图像预算,显著减少 padding。
来源:Hugging Face Blog · huggingface.co