Governed GPU inference ops (vLLM + Ray Serve): latency RCA, scaling, drain, 39 tools.
Governed GPU inference ops (vLLM + Ray Serve): latency RCA, scaling, drain, 39 tools.
Inference AIops · v0.8.0 (latest)
by AIops-tools
75
MCP 2026-07-28
Modern discoveryDiscovery metadata
- Server discover · complete · private cache · TTL 0 ms
- Tools · 1 page · complete · private cache · TTL 0 ms · complete capture
- Prompts · 1 page · complete · private cache · TTL 0 ms · complete capture
- Resources · 1 page · complete · private cache · TTL 0 ms · complete capture
- Resource Templates · 1 page · complete · private cache · TTL 0 ms · complete capture
Server Instructions
GPU inference-cluster operations over vLLM + Ray Serve/Jobs, plus SGLang and TGI single-process engines: vLLM request metrics (TTFT/TPOT/queue depth/KV-cache) and the flagship 'diagnose_latency_spike' / 'diagnose_low_utilization' RCA correlators; engine-agnostic reads (engine_health /...
Tools
Operations this server exposes to clients.