vllm测试部署env
Published on September 1, 2026
起docker
docker pull m.daocloud.io/quay.io/ascend/vllm-ascend:v0.23.0-a3
docker run -it \ --name vllm-ascend-test-yyt-qwen \ --network host \ --shm-size=80g \ --device=/dev/davinci0 \ --device=/dev/davinci1 \ --device=/dev/davinci_manager \ --device=/dev/devmm_svm \ --device=/dev/hisi_hdc \ -v /usr/local/dcmi:/usr/local/dcmi \ -v /usr/local/bin/npu-smi:/usr/local/bin/npu-smi \ -v /usr/local/Ascend/driver/lib64/:/usr/local/Ascend/driver/lib64/ \ -v /usr/local/Ascend/driver/version.info:/usr/local/Ascend/driver/version.info \ -v /etc/ascend_install.info:/etc/ascend_install.info \ -v /mnt/weight:/mnt/weight:ro \ -v /home/y00991458/vllm:/workspace/dev/vllm \ -v /home/y00991458/vllm-ascend:/workspace/dev/vllm-ascend \ m.daocloud.io/quay.io/ascend/vllm-ascend:v0.23.0-a3 \ bash
启动vllm测试
vllm serve /mnt/weight/Qwen3-8B \ --served-model-name qwen3-8b \ --host 127.0.0.1 \ --port 8000
vllm serve /mnt/weight/Qwen3-8B --served-model-name qwen3-8b --host 127.0.0.1 --port 8000
curl http://127.0.0.1:8000/v1/models
curl http://127.0.0.1:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3-0.6b",
"messages": [
{"role": "user", "content": "你好,请简单介绍一下vLLM"}
],
"max_tokens": 1024,
"temperature": 0
}'
启动bench测试
which ais_bench
pip show ais_bench_benchmark
pip install ais_bench_benchmark[full]
源码编译替代
pAI
蓝区随便接入?
那我要接入claude code了