A high-throughput and memory-efficient inference and serving engine for LLMs

88,911 stars Python 1 file ยท ~2,616 tokens #amd#blackwell#cuda#deepseek#deepseek-v3#gpt#gpt-oss#inference

vllm MCP Server

MCP server for vllm-project/vllm

Ready-to-Use Client Configurations
{
  "mcpServers": {
    "vllm": {
      "command": "npx",
      "args": [
        "-y",
        "@vllm-project/vllm"
      ]
    }
  }
}