Loading...
Loading...
Compare original and translation side by side
base_server_flagssearch_spacesearch_spaceconfigs/cookbook-llm/python skills/llm-serving-auto-benchmark/scripts/validate_cookbook_configs.py \
skills/llm-serving-auto-benchmark/configs/cookbook-llm--help--help-dir <artifact-help-dir>python -m sglang.auto_benchmarkpython -m sglang.bench_servingvllm bench sweep servevllm servevllm bench servetrtllm-servetrtllm-serve serve --backend pytorchtrt--backend openai--backend openai-chat--helpbase_server_flagssearch_spacesearch_spaceconfigs/cookbook-llm/python skills/llm-serving-auto-benchmark/scripts/validate_cookbook_configs.py \
skills/llm-serving-auto-benchmark/configs/cookbook-llm--help--help-dir <artifact-help-dir>python -m sglang.auto_benchmarkpython -m sglang.bench_servingvllm bench sweep servevllm servevllm bench servetrtllm-servetrtllm-serve serve --backend pytorchtrt--backend openai--backend openai-chat--helpssh <host>h100_sglangb200_*radixark*rtx5090_*h100h100-sglang-diffusionb200rtx5090radixark02radixark03sglangvllmtensorrt_llmreferences/ssh <host>h100_sglangb200_*radixark*rtx5090_*h100h100-sglang-diffusionb200rtx5090radixark02radixark03sglangvllmtensorrt_llmreferences/scripts/validate_cookbook_configs.py--helpcompare_benchmark_results.pyconfigs/cookbook-llm/references/example-plan.yamlschema_version: 1source.kindllm_serving_cookbookbenchmark.slaframeworks.*.server_commandvalidate_cookbook_configs.pyexample-plan.yamlslaserver_commandscripts/validate_cookbook_configs.py--helpcompare_benchmark_results.pyconfigs/cookbook-llm/references/example-plan.yamlschema_version: 1source.kindllm_serving_cookbookbenchmark.slaframeworks.*.server_commandvalidate_cookbook_configs.pyexample-plan.yamlslaserver_commandsglangvllmtensorrt-llmchatsummarization--helpsglangvllmtensorrt-llmchatsummarization--helpfa3fa3search_spaceflashinfertritonbench_serving--backend sglang/generate--backend sglang-oaisglang-oai--enable-dbo--max-num-partial-prefills > 11trtllm-serve serve--kv_cache_free_gpu_memory_fraction--free_gpu_memory_fraction--help--ipc=host--ulimit memlock=-1--ulimit stack=67108864--shm-size=16gNCCL_IB_DISABLE=1--backend openai--backend openai-chat--backend trtllmpytorchtrtllmbenchmark_serving --dataset-name random--random-ids--download-pathmax_seq_lenmax_model_lencontext_lengthmax(input_len + output_len)search_spacefa3search_spacefa3flashinfertritonbench_serving--backend sglang/generate--backend sglang-oaisglang-oai--enable-dbo--max-num-partial-prefills > 11trtllm-serve serve--kv_cache_free_gpu_memory_fraction--free_gpu_memory_fraction--help--ipc=host--ulimit memlock=-1--ulimit stack=67108864--shm-size=16gNCCL_IB_DISABLE=1--backend openai--backend openai-chat--backend trtllmpytorchtrtllmbenchmark_serving --dataset-name random--random-ids--download-pathmax_seq_lenmax_model_lencontext_lengthmax(input_len + output_len)search_spaceHF_TOKENHUGGINGFACE_HUB_TOKEN-e VARserver_commandbenchmark_commandHF_TOKENHUGGINGFACE_HUB_TOKEN-e VARserver_commandbenchmark_commandpython -m sglang.launch_server --help
python -m sglang.bench_serving --help
vllm serve --help
vllm serve --help=all
vllm bench serve --help
vllm bench serve --help=all
vllm bench sweep serve --help=all
trtllm-serve serve --help
python -m tensorrt_llm.serve.scripts.benchmark_serving --help--helpvllm serve --help--help=all--helptrtllm-serve serve --help--backend pytorch/v1/modelsnvidia-smipython -m sglang.launch_server --help
python -m sglang.bench_serving --help
vllm serve --help
vllm serve --help=all
vllm bench serve --help
vllm bench serve --help=all
vllm bench sweep serve --help=all
trtllm-serve serve --help
python -m tensorrt_llm.serve.scripts.benchmark_serving --help--helpvllm serve --help--help=all--helptrtllm-serve serve --help--backend pytorch/v1/modelsnvidia-smi{"prompt": [{"role": "user", "content": "Summarize this text."}], "output_len": 256}
{"prompt": "Write a short explanation of CUDA graphs.", "output_len": 128}{
"prompt": [{"role": "user", "content": "Use low temperature."}],
"output_len": 256,
"extra_request_body": {"temperature": 0.0, "top_p": 0.95},
"metadata": {"source": "prod-sample"}
}extra_request_bodydataset:
kind: random
num_prompts: 80
scenario_names: [chat, summarization]
input_len: [1000, 8000]
output_len: [1000, 1000]input_lenoutput_leninput_len + output_lencontext_lengthmax_model_lenmax_seq_len{"prompt": [{"role": "user", "content": "Summarize this text."}], "output_len": 256}
{"prompt": "Write a short explanation of CUDA graphs.", "output_len": 128}{
"prompt": [{"role": "user", "content": "Use low temperature."}],
"output_len": 256,
"extra_request_body": {"temperature": 0.0, "top_p": 0.95},
"metadata": {"source": "prod-sample"}
}extra_request_bodydataset:
kind: random
num_prompts: 80
scenario_names: [chat, summarization]
input_len: [1000, 8000]
output_len: [1000, 1000]input_lenoutput_leninput_len + output_lencontext_lengthmax_model_lenmax_seq_lennum_prompts: 80num_prompts: 20search.max_candidates_per_framework: 10search_spacebase_server_flagsmem_fraction_staticschedule_policygpu_memory_utilizationkv_cache_free_gpu_memory_fractionnum_prompts: 80num_prompts: 20search.max_candidates_per_framework: 10search_spacebase_server_flagsmem_fraction_staticschedule_policygpu_memory_utilizationkv_cache_free_gpu_memory_fractionpython -m sglang.auto_benchmark run --config /path/to/sglang.yamlpython -m sglang.bench_serving \
--backend sglang \
--dataset-name random \
--random-input-len 1024 \
--random-output-len 256 \
--num-prompts 80 \
--request-rate 8 \
--output-file /path/to/sglang/results.json \
--output-detailstp_sizepp_sizedp_sizeep_sizeattention_backendprefill_attention_backenddecode_attention_backendsampling_backendmax_running_requestsmax_queued_requestschunked_prefill_sizeprefill_max_requestsmax_prefill_tokensmax_total_tokenspage_sizemem_fraction_staticschedule_policypython -m sglang.auto_benchmark run --config /path/to/sglang.yamlpython -m sglang.bench_serving \
--backend sglang \
--dataset-name random \
--random-input-len 1024 \
--random-output-len 256 \
--num-prompts 80 \
--request-rate 8 \
--output-file /path/to/sglang/results.json \
--output-detailstp_sizepp_sizedp_sizeep_sizeattention_backendprefill_attention_backenddecode_attention_backendsampling_backendmax_running_requestsmax_queued_requestschunked_prefill_sizeprefill_max_requestsmax_prefill_tokensmax_total_tokenspage_sizemem_fraction_staticschedule_policyvllm bench sweep serve \
--serve-cmd 'vllm serve <model> --port 8000' \
--bench-cmd 'vllm bench serve --backend vllm --model <model> --port 8000 --dataset-name random --num-prompts 80' \
--serve-params /path/to/vllm_serve_params.json \
--bench-params /path/to/vllm_bench_params.json \
--output-dir /path/to/vllm_resultsvllm servevllm bench servegpu_memory_utilizationmax_num_seqsmax_num_batched_tokensmax_model_lenenable_chunked_prefill--helpgpu_memory_utilizationmax_num_partial_prefillsvllm bench sweep serve \
--serve-cmd 'vllm serve <model> --port 8000' \
--bench-cmd 'vllm bench serve --backend vllm --model <model> --port 8000 --dataset-name random --num-prompts 80' \
--serve-params /path/to/vllm_serve_params.json \
--bench-params /path/to/vllm_bench_params.json \
--output-dir /path/to/vllm_resultsvllm servevllm bench servegpu_memory_utilizationmax_num_seqsmax_num_batched_tokensmax_model_lenenable_chunked_prefill--helpgpu_memory_utilizationmax_num_partial_prefillstrtllm-serve servetrtllm-serve serve <model> \
--backend pytorch \
--tp_size <tp> \
--pp_size <pp> \
--kv_cache_free_gpu_memory_fraction 0.75 \
--host 0.0.0.0 \
--port 8000benchmark_serving --dataset-name random--download-path--random-ids--random-idstrtllm-serve serve--kv_cache_free_gpu_memory_fraction--free_gpu_memory_fractiontrtllm-serve serve --help--backend pytorchbackend: pytorchbase_server_flagsbackendsearch_spacetrttp_sizepp_sizeep_sizetrtllm-servetrtllm-serve serve--extra_llm_api_optionskv_cache_free_gpu_memory_fractionmax_batch_sizemax_num_tokensmax_seq_lenpytorchtrtllm-serve servetrtllm-serve serve <model> \
--backend pytorch \
--tp_size <tp> \
--pp_size <pp> \
--kv_cache_free_gpu_memory_fraction 0.75 \
--host 0.0.0.0 \
--port 8000benchmark_serving --dataset-name random--download-path--random-ids--random-idstrtllm-serve serve--kv_cache_free_gpu_memory_fraction--free_gpu_memory_fractiontrtllm-serve serve --help--backend pytorchbase_server_flagsbackend: pytorchbackendsearch_spacetrttp_sizepp_sizeep_sizetrtllm-servetrtllm-serve serve--extra_llm_api_optionskv_cache_free_gpu_memory_fractionmax_batch_sizemax_num_tokensmax_seq_lenpytorchpython skills/llm-serving-auto-benchmark/scripts/compare_benchmark_results.py \
--input /path/to/candidates.jsonl \
--output /path/to/summary.mdpython skills/llm-serving-auto-benchmark/scripts/compare_benchmark_results.py \
--input /path/to/candidates.jsonl \
--output /path/to/summary.md