一文从零部署vllm+qwen8B模型 源代码可编译 A100版/3080版的一些小建议和踩雷
查了好多bug……
主包甚至把英伟达驱动卸了重装了一遍
美丽的建议是:系统整体别太旧,赶紧更新吧 不然连CA证书都可能有问题
1、别直接在本机装vllm 的conda环境 请使用docker
2、本机卸载toolkit有时候需要强力卸载 有种中国360的美
3、docker安装可以直接拉取cuda对应的镜像
https://hub.docker.com/layers/nvidia/cuda/12.1.0-devel-ubuntu20.04/images/sha256-a930e9dd3ed41128581b9495ea4b4812938f050a0ff45e1cbbcfdc689221d430
4、拉取镜像之后启动 --gpus可能会报错,这可能是因为你强力卸载的时候删除了对应的驱动,装的话可能又会有报release不识别的问题,改代理可能也无效,最终解决方案是下载到本地然后cpy上去
5、cuda和torch一定要适配。。。。这个vllm官网上有,但不多,还得看民间
6、docker里装好了这几个玩意儿,可能gpt还会建议你在docker里搞虚拟环境,我的建议是跳过这个建议。。。
实操如下:
1、拉取了一个装好cuda12.1和torch2.5的images
HFtoken指南(得挂非中国 中国香港的梯子 以及非中国的企业 qq邮箱等)
https://blog.csdn.net/m0_52625549/article/details/134255660
2、
apt-get update && apt-get install -y git build-essential python3-venv python3-pip \
ninja-build cmake pkg-config
3、不要这一步。。。可怕的开始 请跳过
python3 -m venv /opt/venvs/vllm
source /opt/venvs/vllm/bin/activate
pip install -U pip setuptools wheel packaging
3、
git clone一下vllm
4、
cd /root/vllm-dev/vllm
pip install -U pip setuptools wheel packaging cmake ninja "pybind11>=2.10"
pip install -e ".[all]"
最后一步大概花了三十分钟+
想查看进度可以令开一个终端 htop
5、主包终于可以serve自己的大模型了,我是把docker里的东西映射到本地的 包括vllm和模型参数,挂docker的时候设置的。
更多推荐
所有评论(0)