大模型 活跃维护

vllm

vllm-project/vllm

一个用于大型语言模型的高吞吐量且内存高效的推理和服务引擎

92358
Stars 标星
22488
Forks 分支
599
Watchers 关注
8277
Open Issues
Python
主要语言
Apache-2.0
开源协议
294.0 MB
仓库大小
23 小时前
最后推送
一键安装扩展 / 插件指令
dsh plugin --profile web add github:vllm-project/vllm
git clone https://github.com/vllm-project/vllm.git
git clone git@github.com:vllm-project/vllm.git
README.md main

机器翻译正文由机器翻译自项目原始文档(英文),排版经程序统一处理,可能存在偏差,请以原项目仓库为准。

简单、快速、廉价的 LLM 服务,面向所有人

| Documentation | Blog | Paper | Twitter/X | User Forum | Developer Slack |

🔥 我们已经建立了一个 vLLM 网站来帮助您入门 vLLM。请访问 vllm.ai 了解更多信息。有关活动,请访问 vllm.ai/events 加入我们。


关于

vLLM 是一个用于大语言模型推理和服务的快速且易于使用的库。

vLLM 最初在加州大学伯克利分校的 Sky Computing Lab 开发,由来自 2000 多名贡献者的众多学术机构和公司组成的多元化社区构建和维护,现已发展成为最活跃的开源 AI 项目之一。

vLLM 速度快,具备以下特点:

  • 最先进的服务吞吐量
  • 通过 PagedAttention 高效管理注意力键和值的内存
  • 对接收请求进行连续批处理、分块预填充、前缀缓存
  • 使用分片和完整的 CUDA/HIP 图进行快速且灵活的模型执行
  • 量化:FP8, MXFP8/MXFP4, NVFP4, INT8, INT4, GPTQ/AWQ, GGUF, 压缩张量, ModelOpt, TorchAO,以及更多 链接
  • 优化的注意力内核,包括 FlashAttention、FlashInfer、TRTLLM-GEN、FlashMLA 和 Triton
  • 使用 CUTLASS、TRTLLM-GEN、CuTeDSL 为各种精度优化的 GEMM/MoE 内核
  • 包含 n-gram、后缀、EAGLE、DFlash 的推测性解码
  • 使用 torch.compile 进行自动内核生成和图级转换
  • 分离的预填充、解码和编码

vLLM 灵活且易于使用,具备以下特点:

  • 与流行的 Hugging Face 模型无缝集成
  • 使用多种解码算法进行高吞吐量服务,包括 并行采样束搜索
  • 分布式推理支持张量、流水线、数据、专家和上下文并行
  • 流式输出
  • 使用 xgrammar 或 guidance 生成结构化输出
  • 工具调用和推理解析器
  • 兼容 OpenAI 的 API 服务器,同时支持 Anthropic Messages API 和 gRPC
  • 高效的多 LoRA 支持,适用于稠密层和 MoE 层
  • 支持 NVIDIA GPU、AMD GPU、Intel GPU 以及 x86/ARM/PowerPC CPU。此外,还支持各种硬件插件,如 Google TPU、Intel Gaudi、IBM Spyre、华为昇腾、Rebellions NPU、Apple Silicon、MetaX GPU 等。

vLLM 无缝支持 Hugging Face 上的 200 种模型架构,包括:

  • 仅解码器 LLM(例如:Llama、Qwen、Gemma)
  • 专家混合 LLM(例如:Mixtral、DeepSeek-V3、Qwen-MoE、GPT-OSS)
  • 混合注意力和状态空间模型(例如:Mamba、Qwen3.5)
  • 多模态模型(例如:LLaVA、Qwen-VL、Pixtral)
  • 嵌入与检索模型(例如:E5-Mistral、GTE、ColBERT)
  • 奖励与分类模型(例如:Qwen-Math)

完整支持模型列表请点击这里

入门指南

使用 uv (推荐)或 pip 安装 vLLM:

uv pip install vllm

或者为开发目的从源代码构建

访问我们的文档以了解更多信息。

贡献

我们欢迎并重视任何贡献与合作。请查看 Contributing to vLLM 了解如何参与。

引用

如果您在研究中使用 vLLM,请引用我们的论文

@inproceedings{kwon2023efficient,
  title={Efficient Memory Management for Large Language Model Serving with PagedAttention},
  author={Woosuk Kwon and Zhuohan Li and Siyuan Zhuang and Ying Sheng and Lianmin Zheng and Cody Hao Yu and Joseph E. Gonzalez and Hao Zhang and Ion Stoica},
  booktitle={Proceedings of the ACM SIGOPS 29th Symposium on Operating Systems Principles},
  year={2023}
}

联系我们

  • 对于技术问题和功能请求,请使用 GitHub 问题
  • 与其他用户讨论,请使用 vLLM 论坛
  • 协调贡献和开发,请使用 Slack
  • 关于安全漏洞披露,请使用 GitHub 的 安全咨询 功能
  • 关于合作与伙伴关系,请通过 collaboration@vllm.ai 联系我们

媒体套件

本站来源与版权声明
  • 本文标题:vllm - 一个用于大型语言模型的高吞吐量且内存高效的推理和服务
  • 本文链接:https://cn121.com/llm/vllm-project-vllm.html
  • 原项目:vllm-project/vllm 版权归原作者 vllm-project 及贡献者所有
  • 收录信息:本站于 2026-09-22 收录本项目,本页所列协议与仓库指标均为收录当时的状态;该日期之后原项目的版本更新与协议变更,本页不作同步。
  • 开源协议:收录时本项目采用 Apache-2.0查看 LICENSE 原文),本站译文为其衍生内容;使用、修改、分发请以该仓库 LICENSE 原文为准。本站对原文仅作排版与图片地址适配, 并保留原项目的 NOTICE 与署名要求。
  • 站点出处:本文首发于 OneTwoOne,收录自 GitHub 开源项目 vllm-project/vllm。
  • 翻译说明:本页正文为人工智能生成内容——由机器翻译对原项目 README 初译、经程序校验排版,可能存在错漏,请以原项目文档为准。
  • 引用声明:商业转载、第三方聚合或 AI 检索训练引用时,请务必保留以上来源出处、本文永久链接,以及原项目的版权声明与许可信息
  • 下架通道:若原项目此后变更或收紧了许可协议、或作者/权利人认为本站的收录方式(译文、排版适配、简介翻译等)超出其授权范围,请通过 xyd3302001@163.com 发送下架通知,并附上项目地址与本页链接。本站核实后将第一时间删除本页内容,或改为不复制原文的目录性收录;署名更正等其他要求可一并提出。