SGLang v0.5.15.post1

v0.5.15.post1
Fixed 5
  • Fix DSA model launching on non Cuda/HIP devices
  • Fix flashinfer dependency on Cuda 12 images
  • Fix NaN outputs caused by flashinfer trtllm FP4 MoE kernels on long input
  • Fix GLM 5.2 IndexShare on PD disaggregation setting
  • Fix GLM 5.2 IndexShare on Context Parallel setting

v0.5.15.post1 includes a few patches, mostly for GLM 5.2

  • #30454 #30627: Fix DSA model launching on non Cuda/HIP devices
  • #30858: Fix flashinfer dependency on Cuda 12 images
  • #31001: Fix NaN outputs caused by flashinfer trtllm FP4 MoE kernels on long input
  • #30839: Fix GLM 5.2 IndexShare on PD disaggregation setting
  • #30992: Fix GLM 5.2 IndexShare on Context Parallel setting
View original

Upgraded? How did it go?

Discussion