群发资讯网

自托管 GPU 集群编排:把散落的显卡变成一台 AI 服务器 先说个扎心的现实

自托管 GPU 集群编排:把散落的显卡变成一台 AI 服务器
先说个扎心的现实:手里捏着几张显卡,想自己部署大模型,事情比想象中麻烦得多。
单卡还能凑合跑,装个推理工具就能跑起来。但凡有两三台机器、每台插着不同的卡,要同时跑 vLLM 和 SGLang 两套引擎,那就等着折腾吧——手动装环境、配端口、写启动脚本,模型一更新还得一台台重来。
租云上 GPU 实例按小时计费,短期用用还行,长期跑推理服务,账单比显卡折旧还快。
inferna-next 就是冲着这个来的。这是一个刚冒出来的开源项目(GitHub 上 51 颗星,Apache-2.0 协议),定位是自托管 GPU 集群的"控制平面":你只管选模型,它自动决定跑在哪台机器、用哪张卡、上哪个引擎。
系统架构
整体分三层:
中央服务器:基于 FastAPI,负责认证、权限、模型目录、实例调度,对外提供网页界面和 REST、gRPC 接口。
Worker 代理:跑在每台 GPU 主机上,每 5 秒汇报一次显卡状态和实例健康情况。服务器下发指令后,Worker 负责拉起或销毁推理容器(vLLM 或 SGLang),全程走 Docker。
数据层:PostgreSQL 存数据,Prometheus + Grafana 做监控。
一条  docker compose  命令就能把整套东西跑起来。
部署体验
内置模型目录,Qwen、Llama、Phi、DeepSeek、BGE、Whisper、Qwen2.5-VL 都在里面。选一个模型点部署,它会自动选有空闲显存的机器、选合适的引擎、按"低延迟"或"高吞吐"档位调参。
多厂商 GPU 也在支持范围内。NVIDIA 走 NVML,AMD 走 ROCm,没有真卡还能开模拟模式。另外还内置了 JWT 登录、基于角色的权限控制和监控面板。
现状
项目在早期,文档和稳定性都需要自己踩坑。它的方向有一定价值——把"跑模型"这项重复劳动自动化。对手里有几张卡、想绕开云厂商的团队,可以留意一下后续进展。多机调度和故障恢复做扎实之后,自托管模型服务的门槛会低一些。