FastChat:训练、服务、评测 LLM 的一站式
你大概听过 Chatbot Arena 吧?那个让大模型匿名互搏、靠真人投票排名的网站。它背后跑的就是 FastChat。
这东西不是给只想调 API 的人用的。你要是自己训、部署、打分,它能用一套代码全包了。Vicuna 就是用它微调出来的。它还搞出了 MT-bench,让强模型当裁判打分。
它服务架构挺有意思:不“一个程序加载一个模型”,而是拆成三个进程。Controller 管调度,Model Worker 真正把模型塞进显存做推理。Web 界面和 OpenAI 兼容 API 只跟 Controller 对话,不直接碰模型。
想跑通也不难。装好环境后,不想搭服务就一行命令在命令行聊起来。真要起 Web 界面,开三个终端分别启动控制器、模型进程和服务就行。把接口地址一改,业务代码基本不用动。
不过门槛挺高。Vicuna-7B 约吃 14GB 显存,13B 约 28GB。没独显基本只能看。加 8-bit 能砍半显存,但质量会降。纯 CPU 也能跑,但慢得像牛车。严肃使用强烈建议上独立 GPU。
要是只想要高吞吐生产级推理,或者只要个 OpenAI 兼容网关,换更专的工具更划算。它的甜区就是你要训练、服务、评测这一整条链。
原文FastChat:训练、服务、评测 LLM 的一站式开源平台