vllm
A high-throughput and memory-efficient inference and serving engine for LLMs
vllm MCP Server
MCP server for vllm-project/vllm
Ready-to-Use Client Configurations
{
"mcpServers": {
"vllm": {
"command": "npx",
"args": [
"-y",
"@vllm-project/vllm"
]
}
}
}