|
| 1 | +# sglang metric families, as inference-perf expects to find them on /metrics. |
| 2 | +# |
| 3 | +# provenance: upstream-source |
| 4 | +# server: sglang |
| 5 | +# version: v0.5.17 |
| 6 | +# source: https://github.com/sgl-project/sglang/tree/v0.5.17/python/sglang (metric registrations, chiefly srt/observability/metrics_collector.py) |
| 7 | +# captured: 2026-08-17 |
| 8 | +# |
| 9 | +# Regenerate against a running server: |
| 10 | +# python scripts/capture_server_metric_names.py --server sglang \ |
| 11 | +# --base-url http://127.0.0.1:<port> |
| 12 | +# |
| 13 | +# UNVERIFIED AGAINST A LIVE SERVER. SGLang needs an accelerator to start, and |
| 14 | +# inference-perf has no runner with one yet (#641), so this snapshot was derived |
| 15 | +# by reading the pinned upstream registration code instead of by scraping a |
| 16 | +# running server. Derivation rule, reproducible by hand: every Gauge, Counter, |
| 17 | +# Histogram, Summary and GaugeHistogram construction under python/sglang/ at tag |
| 18 | +# v0.5.17 whose name literal starts with "sglang:". GaugeHistogram wraps a |
| 19 | +# prometheus_client Gauge (python/sglang/srt/utils/gauge_histogram.py), so it is |
| 20 | +# recorded as a gauge. prometheus_client's plain-text exposition appends _total |
| 21 | +# to counter family names; every SGLang counter already ends in _total, so the |
| 22 | +# registered name and the exposed family name coincide here. |
| 23 | +# |
| 24 | +# Two consequences of source derivation, both of which make this file a strict |
| 25 | +# SUPERSET of any single live exposition: |
| 26 | +# - families gated on optional features (disaggregation, hicache, LoRA, spec |
| 27 | +# decoding, grammar) are listed even though a default server never |
| 28 | +# registers them; |
| 29 | +# - metrics-registration is lazy in places, so a freshly started server |
| 30 | +# exposes fewer families than it can register. |
| 31 | +# Anything asserting family-for-family equality against a live server must |
| 32 | +# therefore wait for a live-scrape regeneration. Run the scheduled workflow |
| 33 | +# (.github/workflows/metric_name_drift.yml) once a runner exists, or run |
| 34 | +# scripts/capture_server_metric_names.py by hand against your own server, and |
| 35 | +# commit the result; provenance flips to live-scrape and the equality check |
| 36 | +# stops skipping. |
| 37 | +sglang:backup_bandwidth histogram |
| 38 | +sglang:backup_pgs histogram |
| 39 | +sglang:backuped_tokens_total counter |
| 40 | +sglang:cache_hit_rate gauge |
| 41 | +sglang:cached_tokens_total counter |
| 42 | +sglang:context_len gauge |
| 43 | +sglang:cuda_graph_passes_total counter |
| 44 | +sglang:decode_sum_seq_lens gauge |
| 45 | +sglang:dp_cooperation_forward_execution_seconds_total counter |
| 46 | +sglang:dp_cooperation_realtime_tokens_total counter |
| 47 | +sglang:e2e_request_latency_seconds histogram |
| 48 | +sglang:encoder_cache_entries gauge |
| 49 | +sglang:encoder_cache_evictions_total counter |
| 50 | +sglang:encoder_cache_hit_files_total counter |
| 51 | +sglang:encoder_cache_hit_tokens_total counter |
| 52 | +sglang:encoder_cache_size_mb gauge |
| 53 | +sglang:encoder_cache_total_files_total counter |
| 54 | +sglang:encoder_cache_total_tokens_total counter |
| 55 | +sglang:encoder_dp_pending_requests gauge |
| 56 | +sglang:encoder_mm_items_per_batch histogram |
| 57 | +sglang:encoder_mm_items_per_request histogram |
| 58 | +sglang:encoder_model_forward_seconds histogram |
| 59 | +sglang:encoder_preprocess_seconds histogram |
| 60 | +sglang:encoder_queue_wait_seconds histogram |
| 61 | +sglang:encoder_request_e2e_latency_seconds histogram |
| 62 | +sglang:encoder_requests_received_total counter |
| 63 | +sglang:encoder_requests_total counter |
| 64 | +sglang:encoder_transfer_seconds histogram |
| 65 | +sglang:eplb_balancedness summary |
| 66 | +sglang:eplb_gpu_physical_count histogram |
| 67 | +sglang:estimated_flops_per_gpu_total counter |
| 68 | +sglang:estimated_read_bytes_per_gpu_total counter |
| 69 | +sglang:estimated_write_bytes_per_gpu_total counter |
| 70 | +sglang:evicted_tokens_total counter |
| 71 | +sglang:eviction_duration_seconds histogram |
| 72 | +sglang:failed_session_recoveries_total counter |
| 73 | +sglang:forward_execution_seconds_total counter |
| 74 | +sglang:full_token_usage gauge |
| 75 | +sglang:func_latency_seconds histogram |
| 76 | +sglang:fwd_occupancy gauge |
| 77 | +sglang:gen_throughput gauge |
| 78 | +sglang:generation_tokens_histogram histogram |
| 79 | +sglang:generation_tokens_total counter |
| 80 | +sglang:get_loads_duration_seconds histogram |
| 81 | +sglang:grammar_compilation_time_seconds histogram |
| 82 | +sglang:grammar_ebnf_size histogram |
| 83 | +sglang:grammar_schema_count histogram |
| 84 | +sglang:grammar_tree_traversal_time_avg histogram |
| 85 | +sglang:grammar_tree_traversal_time_max histogram |
| 86 | +sglang:graph_memory_usage_gb gauge |
| 87 | +sglang:hicache_host_total_tokens gauge |
| 88 | +sglang:hicache_host_used_tokens gauge |
| 89 | +sglang:http_requests_active gauge |
| 90 | +sglang:http_requests_total counter |
| 91 | +sglang:http_responses_total counter |
| 92 | +sglang:inter_token_latency_seconds histogram |
| 93 | +sglang:is_cuda_graph gauge |
| 94 | +sglang:kv_available_tokens gauge |
| 95 | +sglang:kv_cache_memory_usage_gb gauge |
| 96 | +sglang:kv_evictable_tokens gauge |
| 97 | +sglang:kv_transfer_alloc_ms histogram |
| 98 | +sglang:kv_transfer_bootstrap_ms histogram |
| 99 | +sglang:kv_transfer_latency_ms histogram |
| 100 | +sglang:kv_transfer_speed_gb_s histogram |
| 101 | +sglang:kv_transfer_total_mb histogram |
| 102 | +sglang:kv_used_tokens gauge |
| 103 | +sglang:load_back_duration_seconds histogram |
| 104 | +sglang:load_back_tokens_total counter |
| 105 | +sglang:lora_pool_slots_total gauge |
| 106 | +sglang:lora_pool_slots_used gauge |
| 107 | +sglang:lora_pool_utilization gauge |
| 108 | +sglang:mamba_available_tokens gauge |
| 109 | +sglang:mamba_evictable_tokens gauge |
| 110 | +sglang:mamba_usage gauge |
| 111 | +sglang:mamba_used_tokens gauge |
| 112 | +sglang:max_running_requests_under_SLO gauge |
| 113 | +sglang:max_total_num_tokens gauge |
| 114 | +sglang:max_total_num_tokens_swa gauge |
| 115 | +sglang:new_token_ratio gauge |
| 116 | +sglang:num_aborted_requests_total counter |
| 117 | +sglang:num_bootstrap_failed_reqs_total counter |
| 118 | +sglang:num_decode_prealloc_queue_reqs gauge |
| 119 | +sglang:num_decode_transfer_queue_reqs gauge |
| 120 | +sglang:num_grammar_aborted_total counter |
| 121 | +sglang:num_grammar_cache_hit_total counter |
| 122 | +sglang:num_grammar_queue_reqs gauge |
| 123 | +sglang:num_grammar_timeout_total counter |
| 124 | +sglang:num_grammar_total counter |
| 125 | +sglang:num_pages gauge |
| 126 | +sglang:num_paused_reqs gauge |
| 127 | +sglang:num_prefill_bootstrap_queue_reqs gauge |
| 128 | +sglang:num_prefill_inflight_queue_reqs gauge |
| 129 | +sglang:num_prefill_retries_total counter |
| 130 | +sglang:num_queue_reqs gauge |
| 131 | +sglang:num_requests_total counter |
| 132 | +sglang:num_retracted_input_tokens_total counter |
| 133 | +sglang:num_retracted_output_tokens_total counter |
| 134 | +sglang:num_retracted_reqs gauge |
| 135 | +sglang:num_retracted_requests_total counter |
| 136 | +sglang:num_running_reqs gauge |
| 137 | +sglang:num_so_requests_total counter |
| 138 | +sglang:num_streaming_sessions gauge |
| 139 | +sglang:num_transfer_failed_reqs_total counter |
| 140 | +sglang:num_unique_running_routing_keys gauge |
| 141 | +sglang:num_used_tokens gauge |
| 142 | +sglang:page_size gauge |
| 143 | +sglang:pending_prealloc_token_usage gauge |
| 144 | +sglang:per_stage_req_latency_seconds histogram |
| 145 | +sglang:prefetch_bandwidth histogram |
| 146 | +sglang:prefetch_pgs histogram |
| 147 | +sglang:prefetched_tokens_total counter |
| 148 | +sglang:prefill_delayer_outcomes_total counter |
| 149 | +sglang:prefill_delayer_wait_forward_passes histogram |
| 150 | +sglang:prefill_delayer_wait_seconds histogram |
| 151 | +sglang:process_cpu_seconds_total counter |
| 152 | +sglang:prompt_tokens_histogram histogram |
| 153 | +sglang:prompt_tokens_total counter |
| 154 | +sglang:queue_time_seconds histogram |
| 155 | +sglang:realtime_tokens_total counter |
| 156 | +sglang:routing_key_all_req_count gauge |
| 157 | +sglang:routing_key_running_req_count gauge |
| 158 | +sglang:routing_keys_active gauge |
| 159 | +sglang:spec_accept_length gauge |
| 160 | +sglang:spec_accept_rate gauge |
| 161 | +sglang:spec_block_accept_length gauge |
| 162 | +sglang:spec_cap_length gauge |
| 163 | +sglang:spec_num_draft_tokens gauge |
| 164 | +sglang:spec_num_steps gauge |
| 165 | +sglang:spec_verify_calls_total counter |
| 166 | +sglang:startup_available_gpu_memory_gb gauge |
| 167 | +sglang:startup_cuda_graph_time_seconds gauge |
| 168 | +sglang:startup_latency_breakdown_seconds_max gauge |
| 169 | +sglang:startup_time_seconds gauge |
| 170 | +sglang:streaming_session_held_tokens gauge |
| 171 | +sglang:swa_available_tokens gauge |
| 172 | +sglang:swa_evictable_tokens gauge |
| 173 | +sglang:swa_token_usage gauge |
| 174 | +sglang:swa_used_tokens gauge |
| 175 | +sglang:time_to_first_token_seconds histogram |
| 176 | +sglang:token_usage gauge |
| 177 | +sglang:uncached_prompt_tokens_histogram histogram |
| 178 | +sglang:utilization gauge |
| 179 | +sglang:weight_load_duration_seconds gauge |
| 180 | +sglang:weight_memory_usage_gb gauge |
0 commit comments