跳到正文

DeepSeek

DeepSeek(深度求索)的模型发布、开源权重与技术报告——开源大模型价格与性能双卷的风向标。

最新精选

第 1–7 条 · 共 7 条
4月24日周五
  1. Hugging Face Blog83

    DeepSeek 发布 V4:MoE 双检查点上线 Hub,主打百万 token 上下文的 Agent 能力

    DeepSeek 发布 V4,在 Hub 上开源 DeepSeek-V4-Pro(1.6T 总参数 / 49B 激活)和 DeepSeek-V4-Flash(284B 总参数 / 13B 激活)两个 instruct 及对应 base 检查点,均支持 1M token 上下文。

    推荐理由:文章拆解了 V4 为长上下文与 Agent 场景做的架构与后训练设计,读者可据此评估开源模型跑长任务的部署成本。

10月29日周三
  1. Hugging Face Blog67

    Hugging Face 分析全球算力格局变迁:中国国产芯片与开源模型加速崛起

    Hugging Face 发布长文分析全球算力格局变化,指出中国开源权重模型的进展正与国产 AI 芯片的快速发展相互推动。近几个月华为昇腾、寒武纪等国产芯片已开始支撑热门开源模型的推理,蚂蚁集团、百度等开始在国产硬件上训练模型。

    推荐理由:文章把美国出口管制与中国芯片进展、开源模型效率创新放在同一条线索里梳理,帮助读者理解算力格局变化的来龙去脉。

5月12日周一
3月27日周四
  1. Hugging Face Blog74

    DeepSeek-V3-0324 上架 Hugging Face Hub,Hugging Face 团队详解性能与使用方式

    DeepSeek-V3 更新版 0324 上架 Hugging Face Hub,架构与原版相同并改为 MIT 许可,重点改进指令遵循、代码与数学能力。官方基准显示 MMLU-Pro 75.9→81.2、AIME 39.6→59.4、LiveCodeBench 39.2→49.2,常与 GPT-4.5 相当、普遍强于 Claude-Sonnet-3.7。

    推荐理由:原文汇总了基准对比、能力改进细节和多种本地部署路径,读者可据此评估是否在自己的工作流中替换旧版 V3。

3月12日周三
  1. Hugging Face Blog63

    Hugging Face Open R1 更新:发布 CodeForces-CoTs 数据集、IOI 基准与 OlympicCoder 7B/32B 模型

    Hugging Face 在 Open R1 第三次更新中发布了从 DeepSeek-R1 蒸馏的 CodeForces-CoTs 数据集(近 10 万样本)、2024 年 IOI 题目构成的 IOI 基准,以及基于 Qwen2.5 Coder 微调的 OlympicCoder-7B 和 OlympicCoder-32B。

    推荐理由:Hugging Face 官方复盘训练过程,给出样本打包、学习率等可复用经验,并附带完整数据集、基准和评测代码。

2月2日周日
1月31日周五