- C20250002's blog
z
- @ 2026-10-10 13:04:56
docker run --rm -it --gpus all --ipc=host --network host
-v ~/.cache/huggingface:/root/.cache/huggingface
nvcr.io/nvidia/vllm:25.09
vllm serve "nvidia/Qwen3.8-27B-NVFP4"
--host 0.0.0.0
--port 8000
--gpu-memory-utilization 0.45
--max-model-len 65536
--kv-cache-dtype fp8
--reasoning-parser qwen3
--tool-call-parser qwen3_xml
--trust-remote-code
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
models:
--- S 级:Qwen3.8-27B (约 25GB 权重,可与其他共存) ---
"Qwen3.8-27B":
name: "Qwen3.8-27B-NVFP4"
cmd: |
vllm serve nvidia/Qwen3.8-27B-NVFP4
--max-model-len 65536
--kv-cache-dtype fp8
--reasoning-parser qwen3
--enable-auto-tool-choice
--tool-call-parser qwen3_xml
gpu_mem: 0.45
env:
VLLM_ATTENTION_BACKEND: "FLASHINFER"
--- L 级:GPT-OSS 120B (约 65GB 权重,独占模式) ---
"GPT-OSS-120B":
name: "GPT-OSS-120B"
cmd: |
vllm serve openai/gpt-oss-120b
--max-model-len 32768
gpu_mem: 0.70
exclusive: true
env:
VLLM_USE_FLASHINFER_MOE_MXFP4_MXFP8: "1"
model_list:
-
model_name: "Qwen3.8-27B" litellm_params: model: "openai/Qwen3.8-27B" api_base: "http://llama-swap:8080/v1" api_key: "sk-your-secure-key-here"
-
model_name: "GPT-OSS-120B" litellm_params: model: "openai/GPT-OSS-120B" api_base: "http://llama-swap:8080/v1" api_key: "sk-your-secure-key-here"
GITHUB_TOKEN=你的ghcr_token_如果有的话 LITELLM_UI_USERNAME=admin LITELLM_UI_PASSWORD=litellm-password-123 POSTGRES_USER=litellm POSTGRES_PASSWORD=litellm-password-123 POSTGRES_DB=litellm DATABASE_URL=postgresql://litellm:litellm-password-123@litellm-db:5432/litellm
https://c7a91e3b-84d2-4c6f-9b71-2e8d4a6f3c11.com/sabusuku?token=994967414f7a5cc2c87cbaee99b2cbf3