docker run --rm -it --gpus all --ipc=host --network host
-v ~/.cache/huggingface:/root/.cache/huggingface
nvcr.io/nvidia/vllm:25.09
vllm serve "nvidia/Qwen3.8-27B-NVFP4"
--host 0.0.0.0
--port 8000
--gpu-memory-utilization 0.45
--max-model-len 65536
--kv-cache-dtype fp8
--reasoning-parser qwen3
--tool-call-parser qwen3_xml
--trust-remote-code

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

models:

--- S 级:Qwen3.8-27B (约 25GB 权重,可与其他共存) ---

"Qwen3.8-27B": name: "Qwen3.8-27B-NVFP4" cmd: | vllm serve nvidia/Qwen3.8-27B-NVFP4
--max-model-len 65536
--kv-cache-dtype fp8
--reasoning-parser qwen3
--enable-auto-tool-choice
--tool-call-parser qwen3_xml gpu_mem: 0.45 env: VLLM_ATTENTION_BACKEND: "FLASHINFER"

--- L 级:GPT-OSS 120B (约 65GB 权重,独占模式) ---

"GPT-OSS-120B": name: "GPT-OSS-120B" cmd: | vllm serve openai/gpt-oss-120b
--max-model-len 32768 gpu_mem: 0.70 exclusive: true env: VLLM_USE_FLASHINFER_MOE_MXFP4_MXFP8: "1"

model_list:

  • model_name: "Qwen3.8-27B" litellm_params: model: "openai/Qwen3.8-27B" api_base: "http://llama-swap:8080/v1" api_key: "sk-your-secure-key-here"

  • model_name: "GPT-OSS-120B" litellm_params: model: "openai/GPT-OSS-120B" api_base: "http://llama-swap:8080/v1" api_key: "sk-your-secure-key-here"

    GITHUB_TOKEN=你的ghcr_token_如果有的话 LITELLM_UI_USERNAME=admin LITELLM_UI_PASSWORD=litellm-password-123 POSTGRES_USER=litellm POSTGRES_PASSWORD=litellm-password-123 POSTGRES_DB=litellm DATABASE_URL=postgresql://litellm:litellm-password-123@litellm-db:5432/litellm

https://c7a91e3b-84d2-4c6f-9b71-2e8d4a6f3c11.com/sabusuku?token=994967414f7a5cc2c87cbaee99b2cbf3