跳到正文
原文
Hugging Face Blog·· 2025-12-11精选AI 评分63

llama.cpp server 新增 router mode 支持多模型动态管理

New in llama.cpp: Model Management

AI 导读

llama.cpp server 新增 router mode,无需重启即可动态加载、卸载和切换多个模型,补上类似 Ollama 的模型管理能力。该功能采用多进程架构,单个模型崩溃不影响其他模型;支持自动发现 GGUF 文件、按需加载、LRU 淘汰(默认 --models-max 4)、请求路由和 Web UI 切换。

推荐理由

原文给出 router mode 的加载与切换机制和具体命令选项,读者可以据此评估本地多模型管理的新工作流。

来源:Hugging Face Blog · huggingface.co