io.github.AIops-tools/inference-aiops icon

Inference AIops

by AIops-tools

io.github.AIops-tools/inference-aiops

Governed GPU inference ops (vLLM + Ray Serve): latency RCA, scaling, drain, 39 tools.

Version 0.8.0 · latest
AI Tools
Local
View source

Inference AIops · v0.8.0 (latest)

by AIops-tools

75
MCP 2026-07-28
Modern discovery

Discovery metadata

  • Server discover · complete · private cache · TTL 0 ms
  • Tools · 1 page · complete · private cache · TTL 0 ms · complete capture
  • Prompts · 1 page · complete · private cache · TTL 0 ms · complete capture
  • Resources · 1 page · complete · private cache · TTL 0 ms · complete capture
  • Resource Templates · 1 page · complete · private cache · TTL 0 ms · complete capture
Server Instructions

GPU inference-cluster operations over vLLM + Ray Serve/Jobs, plus SGLang and TGI single-process engines: vLLM request metrics (TTFT/TPOT/queue depth/KV-cache) and the flagship 'diagnose_latency_spike' / 'diagnose_low_utilization' RCA correlators; engine-agnostic reads (engine_health /...

Tools

Operations this server exposes to clients.

MCP Spec

Unclassified

39