跳到正文

#部署/工程

今日 8 条
4月13日周一
4月1日周三
  1. Hugging Face Blog62

    TII 发布 Falcon Perception 0.6B 早融合感知模型及 0.3B Falcon OCR

    TII Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早融合 Transformer,用混合注意力掩码处理图像块与文本,做自然语言提示的开放词汇定位与分割,在 SA-Co 上达到 68.0 Macro-F1(SAM 3 为 62.3),但在 presence calibration 上落后(MCC 0.64 vs 0.82)。

    推荐理由:TII 自述用单一早融合 Transformer 做开放词汇感知,读者可以看到架构、数据配方和 SA-Co 与 PBench 上的具体对比依据。

  2. Hugging Face Blog66

    Gradio 推出 gradio.Server,支持任意自定义前端搭配 Gradio 后端

    Hugging Face 发布 gradio.Server,一个扩展自 FastAPI 的类,让开发者用 React、Svelte 或原生 HTML/JS 等任意前端框架,同时保留 Gradio 的排队、并发管理、SSE 流式、gradio_client 兼容和 Spaces 上的 ZeroGPU 支持。

    推荐理由:官方介绍了 gradio.Server 如何让任意自定义前端继续复用 Gradio 的排队、MCP 和 ZeroGPU 能力,并附完整代码示例。

3月31日周二
3月27日周五
3月25日周三
3月21日周六
3月18日周三
3月17日周二
3月11日周三
3月10日周二
  1. Hugging Face Blog67

    Hugging Face Hub 推出 Storage Buckets 可变对象存储

    Hugging Face 在 Hub 上推出 Storage Buckets,一种不版本控制的可变、类 S3 对象存储,用于存放 checkpoints、处理后的数据、Agent traces 等中间产物。

    推荐理由:官方发布后明确解释了为什么中间产物不适合放 Git 仓库,并给出 CLI、Python、fsspec 的完整上手路径,便于迁移现有训练和数据流程。

3月9日周一
2月27日周五
2月26日周四
2月19日周四
  1. Hugging Face Blog63

    IBM 与 UC Berkeley 用 IT-Bench 和 MAST 诊断企业级 Agent 的失败原因

    IBM Research 与 UC Berkeley 将 MAST(多智能体系统失败分类法)应用于 ITBench,标注了 310 条由 Gemini-3-Flash、Kimi-K2 和 GPT-OSS-120B 产生的 SRE 执行轨迹,把成功率之外的黑盒失败转成结构化失败签名。

    推荐理由:原文把基准的单一成功率拆解为结构化失败模式,并针对三类模型给出对应的工程修复方向。

2月13日周五
2月9日周一
  1. Hugging Face Blog71

    Transformers.js v4 登陆 NPM,新增 WebGPU 运行时与众多新模型

    Hugging Face 发布 Transformers.js v4,已可在 NPM 安装,核心变化是采用 C++ 重写的 WebGPU Runtime,同一套代码可运行于浏览器、Node、Bun 和 Deno。

    推荐理由:官方发布说明完整列出 WebGPU 运行时重写、新架构支持和构建性能数据,读者可评估在浏览器或服务端本地跑模型的可行性。

2月5日周四
2月4日周三
  1. Google Research39

    Google 提出 Sequential Attention:让 AI 模型更精简快速且不牺牲准确率

    Google Research 提出 Sequential Attention,一种用于特征选择等子集选择问题的贪心算法,利用注意力分数逐步选出最有价值的组件。它将选择过程集成到单次模型训练中,避免了传统贪心方法每步重新训练的高昂开销,以极小代价应用于大规模模型。该方法在多个神经网络基准上取得 SOTA 结果,并支持并行评估候选、提升可解释性。

1月29日周四
  1. Hugging Face Blog66

    Hugging Face 开源 Daggr:用 Python 编排 Gradio 应用并可可视化检查每一步

    Hugging Face Gradio 团队发布开源 Python 库 Daggr(beta,当前版本 0.4.3),用几行代码把 Gradio Spaces、ML 模型和自定义函数连接成 AI 工作流,并自动生成可视化画布。

    推荐理由:Gradio 团队介绍用代码定义 AI 工作流并自动生成可视化画布,可单步检查和重跑,适合在重编排平台和脆弱脚本之外多一个实验选择。

1月22日周四
1月21日周三
1月14日周三
1月9日周五
12月11日周四
  1. Hugging Face Blog63

    llama.cpp server 新增 router mode 支持多模型动态管理

    llama.cpp server 新增 router mode,无需重启即可动态加载、卸载和切换多个模型,补上类似 Ollama 的模型管理能力。该功能采用多进程架构,单个模型崩溃不影响其他模型;支持自动发现 GGUF 文件、按需加载、LRU 淘汰(默认 --models-max 4)、请求路由和 Web UI 切换。

    推荐理由:原文给出 router mode 的加载与切换机制和具体命令选项,读者可以据此评估本地多模型管理的新工作流。

12月5日周五
12月1日周一
11月26日周三
11月25日周二
11月22日周六
  1. Google Research31

    Google Research 用简单 AI 模型预测充电桩可用性,缓解电动车里程焦虑

    Google Research 发布一个轻量级线性回归模型,预测特定时间后电动车充电桩可用的概率。团队在加州和德国的真实充电网络数据上训练,以一天中各小时为特征,在 30 和 60 分钟预测窗口、100 座随机选取的站点上评估,表现优于"保持当前状态"基线。该简单模型依赖易获取的特征即可实现低延迟部署,有助于减少里程焦虑。

11月19日周三
11月17日周一
11月13日周四