大模型 活跃维护

sglang

sgl-project/sglang

SGLang 是一个用于大型语言模型和多模态模型的高性能服务框架。

36459
Stars 标星
9161
Forks 分支
184
Watchers 关注
5347
Open Issues
Python
主要语言
Apache-2.0
开源协议
379.5 MB
仓库大小
18 小时前
最后推送
一键安装扩展 / 插件指令
dsh plugin --profile web add github:sgl-project/sglang
git clone https://github.com/sgl-project/sglang.git
git clone git@github.com:sgl-project/sglang.git
README.md main

机器翻译正文由机器翻译自项目原始文档(英文),排版经程序统一处理,可能存在偏差,请以原项目仓库为准。


🌐 网站 | 博客 | 文档 | 路线图 | 加入 Slack | 每周开发会议 | 幻灯片

新闻

  • [2026/07] 🔥 SGLang 和 Miles 为 Kimi K3 提供了 0 日支持 (博客)。
  • [2026/07] RadixArk 和 Google 将完整的 SGLang 功能引入 TPU (博客)。
  • [2026/07] 使用 SGLang 提供 GLM5.2 NVFP4 代理工作负载:两周内达到 500 TPS (博客)。
  • [2026/06] 🔥 下一代推测解码:DFlash 和 Spec V2 (博客)。
  • [2026/06] SGLang 为最新开放模型提供 0 日支持 (Nemotron 3 Ultra, Nemotron 3 Super, Higgs Audio v3 TTS)。
  • [2026/04] 🔥 DeepSeek-V4 在第 0 天上线:通过 SGLang 和 Miles 从快速推理到验证 RL (博客)。
  • [2026/02] 🔥 使用 SGLang 在 NVIDIA GB300 NVL72 上解锁 25 倍推理性能 (博客)。
  • [2026/01] SGLang Diffusion 加速视频和图像生成 (博客).
更多
  • [2025/12] SGLang 提供最新开源模型的零日支持(MiMo-V2-Flash、Nemotron 3 Nano、Mistral Large 3、LLaDA 2.0 Diffusion LLM、MiniMax M2)。
  • [2025/11] SGLang Diffusion 加速视频和图像生成 (博客)。
  • [2025/10] SGLang 现在通过 SGLang-Jax 后端在 TPU 上本地运行(博客)。
  • [2025/10] PyTorch 2025 会议 SGLang 演讲 (幻灯片).
  • [2025/10] SGLang 与 Nvidia 在旧金山的聚会,10/2 (回顾)。
  • [2025/09] 在 GB200 NVL72 上部署 DeepSeek,并使用 PD 和大规模 EP(第二部分):预填充 3.8 倍,解码吞吐量 4.8 倍 (博客)。
  • [2025/09] SGLang 第 0 天支持带稀疏注意力的 DeepSeek-V3.2(博客)。
  • [2025/08] SGLang x AMD SF 聚会于 8/22 举行:动手 GPU 研讨会、AMD/xAI/SGLang 技术演讲及社交交流 (路线图, 大规模 EP, 亮点, AITER/MoRI, Wave).
  • [2025/08] SGLang 为 OpenAI gpt-oss 模型提供零日支持(说明)
  • [2025/06] SGLang,这一每天处理数万亿令牌的高性能服务基础设施,已被 a16z 授予第三批开源人工智能资助(a16z 博客)。
  • [2025/06] 在 GB200 NVL72 上部署 DeepSeek,使用 PD 和大规模 EP(第 I 部分):解码吞吐量提高 2.7 倍(博客)。
  • [2025/05] 在 96 个 H100 GPU 上部署 DeepSeek,使用 PD 分解和大规模专家并行 (博客)。
  • [2025/03] 在 AMD Instinct MI300X 上对 DeepSeek-R1 推理进行超级加速(AMD 博客)
  • [2025/03] SGLang加入PyTorch生态系统:高效的LLM服务引擎(PyTorch博客)
  • [2025/02] 在 AMD Instinct™ MI300X GPU 上解锁 DeepSeek-R1 推理性能 (AMD 博客)
  • [2025/01] SGLang 为 DeepSeek V3/R1 型号在 NVIDIA 和 AMD GPU 上提供首日支持,并进行了针对 DeepSeek 的优化。(说明,AMD 博客,其他 10 家公司)
  • [2024/12] v0.4 发布:零开销批量调度器、缓存感知负载均衡器、更快的结构化输出(博客)。
  • [2024/10] 首次 SGLang 在线聚会(幻灯片)。
  • [2024/09] v0.3 发布:DeepSeek MLA 提升 7 倍,torch.compile 提升 1.5 倍,多图像/视频 LLaVA-OneVision (博客)。
  • [2024/07] v0.2 发布:使用 SGLang 运行时提供更快的 Llama3 服务(相比 TensorRT-LLM、vLLM)(博客)。
  • [2024/02] SGLang 通过压缩有限状态机实现了 3倍更快的 JSON 解码(博客)。
  • [2024/01] SGLang 使用 RadixAttention 提供高达 5 倍更快的推理速度 (博客)。
  • [2024/01] SGLang 支持官方 LLaVA v1.6 版本演示的服务 (使用方法)。

关于

SGLang 是一个面向大型语言模型和多模态模型的高性能服务框架。它旨在实现从单一 GPU 到大型分布式集群等多种配置下的低延迟和高吞吐量推理。其核心功能包括:

  • 快速运行:通过RadixAttention高效提供前缀缓存、零开销CPU调度器、预填充-解码、推测解码、连续批处理、分页注意、张量/流水线/专家/数据并行、结构化输出、分块预填充、量化(FP4/FP8/INT4/AWQ/GPTQ)及多LoRA批处理。
  • 广泛模型支持:支持多种语言模型(Llama、Qwen、DeepSeek、Kimi、GLM、GPT、Gemma、Mistral等)、嵌入模型(e5-mistral、gte、mcdse)、奖励模型(Skywork)和扩散模型(WAN、Qwen-Image),并可轻松扩展添加新模型。兼容大多数Hugging Face模型和OpenAI API。
  • 广泛的硬件支持:运行于NVIDIA GPU(GB200/B300/H100/A100/Spark/5090)、AMD GPU(MI355/MI300)、Intel Xeon CPU、Google TPU、Ascend NPU 等。
  • 活跃社区:SGLang是开源的,由充满活力的社区支持,广泛被行业采用,全球支持超过40万张GPU。
  • RL 与后训练骨干:SGLang 是一个经过验证的 rollout 后端,用于训练许多前沿模型,具有原生的 RL 集成,并被诸如 AReaL、Miles、slime、Tunix、verl 等知名后训练框架采用。

入门指南

基准与性能

在发布博客中了解更多信息:v0.2 博客、v0.3 博客、v0.4 博客、大规模专家并行、GB200 机架级并行、GB300 长上下文。

联系我们

对于有兴趣大规模采用或部署 SGLang 的企业,包括技术咨询、赞助机会或合作咨询,请通过 sglang@lmsys.org 联系我们。

长期活跃的 SGLang 贡献者有资格获得编码代理赞助,例如 Cursor、Claude Code 或 OpenAI Codex。请通过电子邮件 sglang@lmsys.org 发送您最重要的提交或拉取请求。

致谢

我们从以下项目中学习设计并重用了代码:Guidance、vLLM、LightLLM、FlashInfer、Outlines 和 LMQL。

本站来源与版权声明
  • 本文标题:sglang - SGLang 是一个用于大型语言模型和多模态模型的高
  • 本文链接:https://cn121.com/llm/sgl-project-sglang.html
  • 原项目:sgl-project/sglang 版权归原作者 sgl-project 及贡献者所有
  • 收录信息:本站于 2026-09-27 收录本项目,本页所列协议与仓库指标均为收录当时的状态;该日期之后原项目的版本更新与协议变更,本页不作同步。
  • 开源协议:收录时本项目采用 Apache-2.0(查看 LICENSE 原文),本站译文为其衍生内容;使用、修改、分发请以该仓库 LICENSE 原文为准。本站对原文仅作排版与图片地址适配, 并保留原项目的 NOTICE 与署名要求。
  • 站点出处:本文首发于 OneTwoOne,收录自 GitHub 开源项目 sgl-project/sglang。
  • 翻译说明:本页正文为人工智能生成内容——由机器翻译对原项目 README 初译、经程序校验排版,可能存在错漏,请以原项目文档为准。
  • 引用声明:商业转载、第三方聚合或 AI 检索训练引用时,请务必保留以上来源出处、本文永久链接,以及原项目的版权声明与许可信息。
  • 下架通道:若原项目此后变更或收紧了许可协议、或作者/权利人认为本站的收录方式(译文、排版适配、简介翻译等)超出其授权范围,请通过 xyd3302001@163.com 发送下架通知,并附上项目地址与本页链接。本站核实后将第一时间删除本页内容,或改为不复制原文的目录性收录;署名更正等其他要求可一并提出。