跳到正文

#部署/工程

今日 8 条
6月16日周一
6月12日周四
  1. Hugging Face Blog64

    Hugging Face Kernel Hub 五分钟入门教程

    Hugging Face 官方博客介绍 Kernel Hub,开发者可通过 kernels 库的 get_kernel 一行代码加载预编译的优化计算内核,自动匹配 Python、PyTorch 和 CUDA 版本。

    推荐理由:原文给出从加载到基准测试的完整可复现步骤,读者可据此评估把优化内核接入自己模型的实际收益。

6月11日周三
  1. Mistral AI53

    Mistral AI 发布 AI 基础设施服务 Mistral Compute

    Mistral AI 发布 Mistral Compute,向客户提供私有集成 AI 基础设施,涵盖 GPU、编排、API、产品和服务,形态从裸金属服务器到全托管 PaaS。作为 NVIDIA 合作伙伴,初期提供数万块 GPU 并计划快速扩张,面向欧洲、中东、亚洲及南半球的主权、企业和研究机构,强调数据主权、欧洲合规与脱碳能源,已有 Orange、BNP Paribas、Thales 等启动伙伴。

6月4日周三
6月3日周二
5月28日周三
  1. Hugging Face Blog60

    Hugging Face 提出 Structured CodeAgent:用结构化生成提升代码智能体可靠性

    Hugging Face 发布研究,让 CodeAgent 以强制 JSON 结构同时生成 thoughts 和 code,在 GAIA、MATH、SimpleQA、Frames 等基准上比常规 CodeAgent 平均高出 2-7 个百分点。

    推荐理由:原文给出结构化输出结合 CodeAgent 的实测数据与适用边界,读者可据此判断自己的模型规模是否适合启用该方案。

5月23日周五
5月22日周四
5月21日周三
  1. Hugging Face Blog62

    Hugging Face Diffusers 量化后端实战:以 Flux-dev 为例对比 BnB、torchao、Quanto、GGUF 与 FP8

    Hugging Face 发布 Diffusers 量化后端解读文章,以 black-forest-labs/FLUX.1-dev 为例实测 bitsandbytes、torchao、Quanto、GGUF 和 FP8 Layerwise Casting 五种方案。

    推荐理由:文章系统对比了 Diffusers 各量化后端在 Flux-dev 上的内存、速度与画质差异,并给出选型建议和可复现代码。

5月15日周四
5月13日周二
5月8日周四
5月7日周三
4月29日周二
4月16日周三
4月9日周三
4月4日周五
  1. Hugging Face Blog55

    Gradio 月活开发者突破 100 万,团队复盘五年增长经验

    Hugging Face 团队宣布 Gradio 每月有超过 100 万开发者使用,并复盘五年增长经验。核心做法包括以 Gradio Blocks 等低层原语代替高层抽象(gr.Blocks 占 80% 用量)、用 share links 一行代码实现应用传播、聚焦机器学习 Web 应用这一细分场景、不设路线图只做快速迭代,以及让每个应用同时生成 API 端点以便本地部署或程序化调用。

4月2日周三
3月31日周一
3月28日周五
3月24日周一
3月21日周五
3月18日周二
3月4日周二
  1. Hugging Face Blog48

    Hugging Face 与 JFrog 合作提升 AI 模型安全扫描透明度

    Hugging Face 宣布与 JFrog 合作,将 JFrog 的扫描器集成到 Hugging Face Hub,以提升模型安全检测。与仅做模式匹配的 picklescan 不同,JFrog 会解析并分析模型权重中的代码,降低误报,并可检出 pickle 反序列化和 Keras Lambda 层等任意代码执行漏洞。所有公开模型仓库在推送后自动扫描,目前已扫描数亿个文件。

2月28日周五
2月25日周二
  1. Hugging Face Blog62

    Hugging Face 发布 Python 实时通信库 FastRTC

    Hugging Face 发布 FastRTC,一个面向 Python 的实时通信库,用于简化实时音视频 AI 应用开发。库内自动处理语音检测与轮次切换,自带 WebRTC Gradio UI,支持 WebRTC 和 WebSocket,可将 Stream 挂载到任意 FastAPI 应用。

    推荐理由:官方发布 Python 实时通信库,内置语音检测、Gradio UI 和免费电话接入,作者还演示了接入 LLM 的完整语音对话代码。

2月24日周一
2月18日周二
2月14日周五
2月13日周四
2月12日周三
2月7日周五
1月30日周四
  1. Mistral AI66

    Mistral 发布 Mistral Small 3:24B 参数开源模型,性能对标 Llama 3.3 70B

    Mistral 发布 Mistral Small 3,一个延迟优化的 24B 参数模型,以 Apache 2.0 许可开源预训练和指令微调权重。模型 MMLU 准确率超 81%,延迟 150 tokens/s,官方称性能与 Llama 3.3 70B instruct 相当且在相同硬件上快 3 倍以上。

    推荐理由:24B 参数、Apache 2.0 开源、可在单卡 RTX 4090 本地运行,读者可据此评估低延迟场景下的替代方案。