跳到正文

全部动态

今日 7 条
1月24日周三
1月19日周五
1月18日周四
1月16日周二
1月15日周一
1月14日周日
1月12日周五
1月10日周三
  1. OpenAI News73

    OpenAI 推出 GPT Store

    OpenAI 宣布推出 GPT Store。原文正文抓取失败,仅标题可用,具体功能和细节未知。

    推荐理由:原文标题宣布 GPT Store 上线,但正文抓取失败,细节无从确认。

1月8日周一
1月4日周四
1月2日周二
  1. Hugging Face Blog68

    Hugging Face 发布 SDXL Dreambooth LoRA 进阶训练脚本指南

    Hugging Face 发布 SDXL Dreambooth LoRA 进阶训练社区指南,将 Replicate SDXL Cog trainer 的 Pivotal Tuning 与 Kohya trainer 使用的 Prodigy 优化器等多项优化组合,脚本已在 diffusers 开源并提供 Colab 与 Spaces 入口。

    推荐理由:官方博客给出把 Pivotal Tuning 与 Prodigy 优化器组合进 SDXL Dreambooth LoRA 训练的完整做法与实验对比,参数可直接复用。

12月20日周三
12月18日周一
12月14日周四
12月13日周三
12月11日周一
  1. Mistral AI83

    Mistral AI 发布开放权重的稀疏混合专家模型 Mixtral 8x7B

    Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可的开放权重稀疏混合专家模型(SMoE),在多数基准上超过 Llama 2 70B 且推理快 6 倍,多数标准基准上匹配或超越 GPT3.5。

    推荐理由:官方给出稀疏专家架构的参数激活比例、基准对比与部署方案,为开源模型选型提供了具体的成本性能参考。

  2. Hugging Face Blog66

    Hugging Face 深入解读 Mixture of Experts(MoE)的原理、训练与推理取舍

    Hugging Face 发布长文系统讲解 MoE(专家混合)架构,以 Mixtral 8x7B 的走红为背景,覆盖稀疏层、路由、负载均衡、Switch Transformers 等核心内容。文章指出 MoE 相同参数量下推理更快、预训练更省算力,但需加载全部参数(Mixtral 8x7B 需按 47B 稠密模型准备显存),且微调更易过拟合,指令微调等新方向有望缓解这一短板。

    推荐理由:这篇解读把 MoE 的结构、路由、负载均衡和微调取舍讲成一条完整脉络,读完能自己判断何时该选稀疏 MoE 而非稠密模型。

12月6日周三
12月5日周二
12月1日周五
  1. Hugging Face Blog54

    Hugging Face 排查 Open LLM Leaderboard 中 DROP 评测分数异常并暂时移除该基准

    Hugging Face 宣布从 Open LLM Leaderboard 中移除 DROP 基准,原因是多数模型 f1 分数异常低于 10。排查发现归一化步骤会漏掉后接非空格空白字符的数字,且以句号作为生成结束符会截断浮点答案并拉低高质量模型分数;按换行符重切分后分数与整体表现相关性明显改善。团队在与 EleutherAI 讨论后决定待新版本评测开发完成前先移除 DROP,并邀请社区反馈。

11月29日周三
  1. OpenAI News93

    Sam Altman 回任 OpenAI CEO,董事会完成重组

    OpenAI 官方宣布 Sam Altman 回任 CEO,公司组建新的初始董事会。Mira Murati 继续担任 CTO,Greg Brockman 回任总裁,公告同时附有 Altman 与董事长 Bret Taylor 的公开信。

    推荐理由:OpenAI 官方公告高层与董事会安排,读者可从中确认这一治理动荡的最终落点。

11月17日周五
11月9日周四
11月7日周二
11月6日周一