Loading...
Loading...
Compare original and translation side by side
vllm/vllm-openai:latestnvcr.io/nvidia/sglang:26.01-py3vllm/vllm-openai:latestnvcr.io/nvidia/sglang:26.01-py3jetson-inference-mem-tunejetson-inference-mem-tunethororinHF_TOKENjetson-inference-mem-tunethororinHF_TOKENjetson-inference-mem-tunejetson-llm-servevllm/vllm-openai:latestnvcr.io/nvidia/sglang:26.01-py3docker run--host 0.0.0.0 --port 8000http://<jetson-ip>:8000/v1curl http://localhost:8000/v1/modelsvLLMjetson-llm-servevllm/vllm-openai:latestnvcr.io/nvidia/sglang:26.01-py3vllm/vllm-openai:latest--host 0.0.0.0 --port 8000docker runhttp://<jetson-ip>:8000/v1curl http://localhost:8000/v1/modelsvLLMvllm/vllm-openai:latestvllm/vllm-openai:latestnvcr.io/nvidia/sglang:26.01-py3| Jetson family | Runtime path |
|---|---|
| Thor (T5000, T4000) | upstream vLLM 0.20+ ( |
| AGX Orin / Orin NX / Nano | Orin JetPack 7.2 / L4T r39+: upstream vLLM 0.20+ ( |
. skills/jetson-diagnostic/scripts/detect_jetson.shJETSON_GENERATIONthororinJETSON_PRODUCT_LINEthor-agxorin-nanoJETSON_SKUbash skills/jetson-diagnostic/scripts/detect_jetson.shbashvllm/vllm-openai:latestvllm/vllm-openai:latestnvcr.io/nvidia/sglang:26.01-py3| Jetson型号 | 运行路径 |
|---|---|
| Thor(T5000、T4000) | 上游vLLM 0.20+( |
| AGX Orin / Orin NX / Nano | Orin JetPack 7.2 / L4T r39+:上游vLLM 0.20+( |
. skills/jetson-diagnostic/scripts/detect_jetson.shJETSON_GENERATIONthororinJETSON_PRODUCT_LINEthor-agxorin-nanoJETSON_SKUbash skills/jetson-diagnostic/scripts/detect_jetson.shbashsudo nvpmodel -m 0 && sudo jetson_clockssudo nvpmodel -m 0 && sudo jetson_clocksvllm/vllm-openai:latestdocker run --rm -it --runtime nvidia --network host --ipc host --name vllm \
-v "$HOME/.cache/huggingface:/root/.cache/huggingface" \
-e HF_TOKEN="$HF_TOKEN" \
vllm/vllm-openai:latest \
vllm serve <hf-repo-id> \
--host 0.0.0.0 --port 8000 \
--max-model-len 8192 \
--gpu-memory-utilization 0.75 \
--tensor-parallel-size 1vllm/vllm-openai:latestdocker run --rm -it --runtime nvidia --network host --name vllm \
-v "$HOME/.cache/huggingface:/root/.cache/huggingface" \
-e HF_TOKEN="$HF_TOKEN" \
ghcr.io/nvidia-ai-iot/vllm:latest-jetson-orin \
vllm serve <hf-repo-id> \
--host 0.0.0.0 --port 8000 \
--max-model-len 4096 \
--gpu-memory-utilization 0.85 \
--tensor-parallel-size 1HF_TOKEN-e HF_TOKEN="$HF_TOKEN"HF_TOKENApplication startup complete.http://0.0.0.0:8000/v1nvcr.io/nvidia/sglang:26.01-py3docker run --rm -it --runtime nvidia --network host --ipc host --name sglang \
-v "$HOME/.cache/huggingface:/root/.cache/huggingface" \
-e HF_TOKEN="$HF_TOKEN" \
nvcr.io/nvidia/sglang:26.01-py3 \
python3 -m sglang.launch_server \
--model-path <hf-repo-id> \
--host 0.0.0.0 \
--port 8000 \
--mem-fraction-static 0.60 \
--max-running-requests 8vllm/vllm-openai:latestdocker run --rm -it --runtime nvidia --network host --ipc host --name vllm \
-v "$HOME/.cache/huggingface:/root/.cache/huggingface" \
-e HF_TOKEN="$HF_TOKEN" \
vllm/vllm-openai:latest \
vllm serve <hf-repo-id> \
--host 0.0.0.0 --port 8000 \
--max-model-len 8192 \
--gpu-memory-utilization 0.75 \
--tensor-parallel-size 1vllm/vllm-openai:latestdocker run --rm -it --runtime nvidia --network host --name vllm \
-v "$HOME/.cache/huggingface:/root/.cache/huggingface" \
-e HF_TOKEN="$HF_TOKEN" \
ghcr.io/nvidia-ai-iot/vllm:latest-jetson-orin \
vllm serve <hf-repo-id> \
--host 0.0.0.0 --port 8000 \
--max-model-len 4096 \
--gpu-memory-utilization 0.85 \
--tensor-parallel-size 1HF_TOKEN-e HF_TOKEN="$HF_TOKEN"HF_TOKENApplication startup complete.http://0.0.0.0:8000/v1nvcr.io/nvidia/sglang:26.01-py3docker run --rm -it --runtime nvidia --network host --ipc host --name sglang \
-v "$HOME/.cache/huggingface:/root/.cache/huggingface" \
-e HF_TOKEN="$HF_TOKEN" \
nvcr.io/nvidia/sglang:26.01-py3 \
python3 -m sglang.launch_server \
--model-path <hf-repo-id> \
--host 0.0.0.0 \
--port 8000 \
--mem-fraction-static 0.60 \
--max-running-requests 8| Knob | Orin Nano / NX | AGX Orin / Thor |
|---|---|---|
| | |
| | |
| | |
--gpu-memory-utilizationjetson-inference-mem-tune| 参数 | Orin Nano / NX | AGX Orin / Thor |
|---|---|---|
| | |
| | |
| | |
--gpu-memory-utilizationjetson-inference-mem-tune| Jetson family | First choice | Acceptable fallback |
|---|---|---|
| Thor | NVFP4 when the model/runtime supports it | W4A16 |
| Orin Nano / NX | W4A16 | AWQ or GPTQ 4-bit |
| AGX Orin | W4A16 | AWQ or GPTQ 4-bit |
Ollama| Jetson型号 | 首选方案 | 可接受的备选方案 |
|---|---|---|
| Thor | NVFP4(若模型/运行时支持) | W4A16 |
| Orin Nano / NX | W4A16 | AWQ或GPTQ 4-bit |
| AGX Orin | W4A16 | AWQ或GPTQ 4-bit |
Ollamavllm servelive-vlm-webuihttp://<jetson-ip>:8000/v1vllm servelive-vlm-webuihttp://<jetson-ip>:8000/v1jetson-inference-mem-tunejetson-memory-auditjetson-inference-mem-tunejetson-memory-audit/proc/device-tree/modelNVIDIA Jetsonnvpmodel -qMAXNMAXN_*MAXN_SUPERnvidia-smi -Lnvidia-smi mig -lgisudo lsof /dev/nvidia*Xorgnvargus-daemonvllmdocker ps --format '{{.Names}}'docker rm -f vllmdocker info | grep -i 'runtimes.*nvidia'nvidia-smi~/.cache/huggingfaceHF_TOKEN/proc/device-tree/modelNVIDIA Jetsonnvpmodel -qMAXNMAXN_*MAXN_SUPERnvidia-smi -Lnvidia-smi mig -lgisudo lsof /dev/nvidia*Xorgnvargus-daemonvllmdocker ps --format '{{.Names}}'docker rm -f vllmdocker info | grep -i 'runtimes.*nvidia'nvidia-smi~/.cache/huggingfaceHF_TOKENlatestjetson-inference-mem-tunegdm3nvargus-daemonlatestjetson-inference-mem-tunegdm3nvargus-daemonjetson-llm-benchmarkjetson-speculative-decoding--speculative-config '{...}'vllm servejetson-inference-mem-tunejetson-llm-benchmarkjetson-speculative-decodingvllm serve--speculative-config '{...}'jetson-inference-mem-tune