跳到正文

开源生态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

226条精选相关主题模型发布Hugging FaceAI 编码

最新精选

第 181–200 条 · 共 226 条
10月3日周二
9月27日周三
  1. Mistral AI81

    Mistral AI 发布开源模型 Mistral 7B

    Mistral AI 发布 7.3B 参数开源模型 Mistral 7B,采用 Apache 2.0 许可证,在所有基准上超越 Llama 2 13B,并在多数基准上优于 Llama 1 34B。

    推荐理由:官方给出与 Llama 2 全面对比的评测数据和架构改进细节,读者可据此评估 7B 级开源模型的性价比与部署选择。

  2. Mistral AI84

    Mistral AI 发布首个 7B 参数开源模型 Mistral 7B,采用 Apache 2.0 许可

    Mistral AI 发布首个模型 Mistral 7B,在标准英文和代码基准上超越所有现有 13B 参数以下的开放模型,权重以 Apache 2.0 许可开放。官方称 MMLU 上超过 60% 的最小模型在两年内从 280B 的 Gopher 缩小到 7B,并同步开设 GitHub 仓库和 Discord 频道推进社区协作。

    推荐理由:官方阐述开源模型路线并给出 MMLU 演进脉络,读者可借此理解 7B 小模型与专有模型的差距变化。

9月8日周五
  1. Hugging Face Blog61

    T2I-Adapter-SDXL 适配器发布并登陆 diffusers

    Hugging Face Diffusers 团队与 T2I-Adapter 作者合作,为 Stable Diffusion XL 推出 T2I-Adapter 支持,并发布 sketch、canny、lineart、depth、openpose 五种条件的 checkpoints。

    推荐理由:原文给出 T2I-Adapter-SDXL 与 ControlNet 的参数量对比、训练配置和完整用法代码,读者可以据此评估并直接上手使用。

9月6日周三
8月25日周五
  1. Hugging Face Blog83

    Code Llama 发布:Llama 2 代码特化系列模型接入 Hugging Face 生态

    Hugging Face 发布 Code Llama 系列开源代码模型集成,含 7B、13B、34B 三种规格,基于 Llama 2 在 500B token 代码数据上训练,提供 Python 特化版和指令微调版。

    推荐理由:官方完整介绍了模型规格、上下文扩展原理和生态接入方式,读者可以直接据此选择规格并上手部署使用。

8月23日周三
  1. Hugging Face Blog74

    Hugging Face 在 Transformers 中集成 AutoGPTQ,支持 GPTQ 量化大语言模型

    Hugging Face 宣布将 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法以 8、4、3 或 2-bit 精度量化和运行模型,4-bit 量化精度损失可忽略,小 batch 下推理速度接近 fp16 基线。

    推荐理由:官方宣布 AutoGPTQ 集成进 Transformers,读者可据此了解 4-bit 量化 LLM 的内存收益、用法与局限。

8月22日周二
  1. Hugging Face Blog71

    Hugging Face 发布开源视觉语言模型 IDEFICS,复现 Flamingo

    Hugging Face 发布开源视觉语言模型 IDEFICS,是 DeepMind 未公开的 Flamingo 的开放复现,接受任意图像和文本序列输入并生成文本,在多个图像文本理解基准上与原闭源模型表现相当。

    推荐理由:原文说明了 IDEFICS 基于 Flamingo 的复现路线、参数规模与完全公开数据的训练方式,适合关注开源多模态模型生态的读者。

8月8日周二
7月27日周四
  1. Hugging Face Blog74

    Apple 与 Hugging Face 发布 Stable Diffusion XL 的 Core ML 版本及混合位宽量化方案

    Apple 与 Hugging Face 将 Stable Diffusion XL 移植到 Core ML,发布完整 pipeline 和 mixed-bit palettization 量化版本,UNet 以平均 4.5 位压缩后体积从 4.8GB 降至 1.4GB(减少 71%)。

    推荐理由:原文给出 Stable Diffusion XL 在 Mac 上的 Core ML 移植细节、压缩到 4.5 位后体积从 4.8GB 降到 1.4GB 的数据,以及可复用的混合位宽量化方法。

7月18日周二
7月3日周一
  1. Hugging Face Blog63

    Hugging Face 教程:用 WizardCoder-15B 在 Node.js 中搭建文本生成网页应用

    Hugging Face 发布教程,展示用 Node.js 搭建文本到网页应用的生成器,模型采用部署在 Inference Endpoints 上的 WizardCoder-15B,通过 Express.js 流式渲染生成 HTML。

    推荐理由:Hugging Face 官方教程给出从 Endpoint 部署到流式渲染的完整代码,读者可以照着复现一个文本生成网页应用的服务。

6月15日周四
  1. Hugging Face Blog66

    Hugging Face 讲解如何在 iPhone、iPad 和 Mac 上用 Core ML 加速 Stable Diffusion

    Apple 在 WWDC'23 中更新 Core ML 与 coremltools 的压缩优化能力,配合开源仓库 ml-stable-diffusion,支持将 Stable Diffusion 量化为 8/6/4/2-bit palettization,推荐 6-bit 以在精度损失很小的前提下加快推理并节省内存。

    推荐理由:作者亲测 6-bit palettization 带来的生成速度提升,并给出完整转换命令和 Hub 模型,读者可按步骤迁移到自己微调的模型。

6月7日周三
  1. Hugging Face Blog65

    Hugging Face Hub 支持用 DuckDB 以 SQL 查询 5 万多个数据集

    Hugging Face 宣布用户可以在 Hub 上的任何数据集上用 DuckDB 运行 SQL 查询。Dataset Viewer 会自动把所有公开数据集转换为 Parquet 文件,可通过 /parquet 端点获取文件 URL;借助 httpfs 扩展,DuckDB 能直接对远程 Parquet 文件执行 SQL,并支持查询被切分为 500MB 分块的大数据集。

    推荐理由:官方介绍了用 DuckDB 直接对 Hub 上 5 万多数据集跑 SQL 的方法,读者可以照着把 Parquet 端点和查询代码迁移到自己的数据探索流程。

6月5日周一
5月24日周三
5月15日周一
  1. Hugging Face Blog64

    RWKV 架构接入 Hugging Face transformers 库:兼具 RNN 与 transformer 优势

    RWKV 是一种结合 RNN 与 transformer 优势的新架构,已通过 PR 正式集成到 Hugging Face transformers 库。该架构训练时可并行(类似线性化 GPT),推理时仅需矩阵向量运算、内存不随上下文增长;已有训练上下文长度 8192 的模型与 ctx1024 模型速度和内存相当。

    推荐理由:RWKV 结合 RNN 与 transformer 两种架构的优势,官方介绍了其原理、可用模型规模及在 transformers 库中的实际用法。

5月9日周二
5月8日周一
  1. Hugging Face Blog61

    Hugging Face 深入解析文本生成视频模型的现状与实践

    Hugging Face 发布博客,梳理文本生成视频模型从 GAN、Transformer 到扩散模型的演进脉络,并对比文本生成图像任务解释其在计算成本、数据集和视频描述上的挑战。

    推荐理由:系统梳理了文本生成视频模型的技术演进、数据集挑战与代表工作,并给出 Diffusers 上的可复用代码与演示入口。

5月4日周四