跳到正文

全部动态

今日 7 条
3月15日周五
3月13日周三
3月8日周五
3月6日周三
3月5日周二
3月4日周一
2月29日周四
2月28日周三
2月27日周二
2月26日周一
  1. Mistral AI75

    Mistral 发布旗舰模型 Mistral Large 与低延迟 Mistral Small

    Mistral 发布旗舰语言模型 Mistral Large,称其在常用基准上仅次于 GPT-4,可通过 la Plateforme 和 Azure 使用,支持 32K tokens 上下文、英法德西意多语言、function calling 和 JSON 输出。同时发布优化延迟与成本的 Mistral Small,性能超过 Mixtral 8x7B,并简化了端点产品线、新增多币种定价。

    推荐理由:官方给出了 Mistral Large 的基准对比、多语言与 function calling 能力,读者可据此评估它在 API 可用模型中的位置。

  2. Mistral AI62

    Mistral AI 发布对话助手 Le Chat

    Mistral AI 发布对话助手 Le Chat,作为与 Mistral 各模型交互的产品入口,底层可用 Mistral Large、Mistral Small 或原型模型 Mistral Next。

    推荐理由:官方宣布对话助手并说明可用的底层模型与企业版方向,读者可借此了解 Mistral 模型的实际产品入口。

  3. Hugging Face Blog56

    Hugging Face 讲解 AI 水印技术:工具与方法入门

    Hugging Face 发布 AI 水印入门博客,讲解图像、文本和音频内容的加水印方法及优缺点。文中介绍生成时嵌入与生成后添加两大类方法、Nightshade 与 Glaze 等图像防滥用工具、基于红绿 token 的 LLM 文本水印,以及 AudioSeal 语音水印,并列出 Hub 上 IMATAG、Truepic 等相关工具,同时指出文本检测在文本较短或模型未知时可靠性有限。

2月23日周五
  1. Hugging Face Blog65

    Hugging Face 发布 Gemma 模型 LoRA/QLoRA 微调教程

    Hugging Face 发布 Gemma 模型微调教程,演示用 Transformers、PEFT 与 trl 的 SFTTrainer,通过 LoRA 和 4-bit QLoRA(bitsandbytes、nf4 量化)在 google/gemma-2b 上以 english_quotes 数据集训练模型按指定格式输出名言和作者。

    推荐理由:Hugging Face 官方用 LoRA 和 4-bit QLoRA 给出 Gemma 微调的完整可复现代码,覆盖 GPU 和 TPU 两种路径。

2月21日周三
2月20日周二
2月19日周一
  1. Hugging Face Blog61

    Hugging Face PEFT 新增多種 LoRA adapter 合并方法

    Hugging Face 在 PEFT 中为 LoRA adapter 新增多種合并方法,可通过 add_weighted_adapter() 调用,包括 cat、linear、svd、ties、dare_linear、dare_ties、magnitude_prune 及其 svd 变体。

    推荐理由:官方详细介绍 PEFT 新增的多种 LoRA 合并方法及代码示例,还给出不同场景下的实测选择建议,便于直接复用。

2月16日周五
  1. Hugging Face Blog70

    Hugging Face 教程:用开源 LLM 生成合成数据微调专用模型,节省成本、时间和碳排放

    Hugging Face 发布教程,展示用 Mixtral-8x7B-Instruct-v0.1 生成合成数据,再通过 AutoTrain 微调 RoBERTa-base 做金融新闻情绪分类。

    推荐理由:原文给出可复用的合成数据蒸馏流程和成本对比数字,读者可以照此把自己的分类任务从 LLM API 迁到专用小模型。

2月15日周四
  1. OpenAI News80

    OpenAI 发布视频生成模型 Sora,探索视频生成模型作为世界模拟器

    OpenAI 发布视频生成模型 Sora,在可变时长、分辨率和宽高比的视频与图像上联合训练文本条件扩散模型,并采用作用于时空 patch 的 Transformer 架构。Sora 可生成一分钟高保真视频,OpenAI 认为扩大视频生成模型规模是构建通用物理世界模拟器的可行路径。

    推荐理由:官方说明 Sora 的技术路线和可生成一分钟视频的能力,适合关注视频生成与世界模拟器方向的读者。

2月14日周三
2月13日周二
2月8日周四
2月3日周六
  1. Hugging Face Blog63

    Segmind 发布 SegMoE 框架,可用混合专家方式组合扩散模型

    SegMoE 框架正式发布,可将多个预训练扩散模型合并为混合专家模型,已集成 Hugging Face diffusers 并以 Apache 2.0 开源。发布 SegMoE-2x1、SegMoE-4x2 和 SegMoE-SD4x2 三个模型,用户只需编写 config.yaml 运行命令即可在几分钟内创建自己的 MoE 模型。

    推荐理由:官方介绍了 SegMoE 的 MoE 架构、三个已发布模型和自制方法,读者可以据此尝试组合预训练扩散模型。

2月2日周五
2月1日周四
  1. Hugging Face Blog64

    Hugging Face 发布开源模型 Constitutional AI 完整配方及 llm-swarm 工具

    Hugging Face 发布了用开源模型实现 Anthropic Constitutional AI 的端到端配方,并开源了基于 TGI 和 vLLM、在 Slurm 集群上做规模化合成数据生成的工具 llm-swarm。

    推荐理由:原文给出了开源模型跑通 Constitutional AI 的完整配方与实验数据,读者可以照着复现自己的对齐流程。

1月31日周三
1月30日周二
1月29日周一
1月26日周五
1月25日周四