Tags: ncsu-swat/vllm
Tags
[ROCm][Bugfix] Fix Mamba batched decode producing incorrect output (v… …llm-project#32099) Signed-off-by: Andreas Karatzas <akaratza@amd.com>
[Bugfix] Fix tool_choice="none" being ignored by GPT-OSS/harmony mode… …ls (vllm-project#30867) Signed-off-by: yujiepu <pyjapple@gmail.com> Signed-off-by: PlatinumGod <pyjapple@gmail.com> Co-authored-by: Chauncey <chaunceyjiang@gmail.com>
Check for truthy `rope_parameters` not the existence of it (vllm-proj… …ect#30983) Signed-off-by: Harry Mellor <19981378+hmellor@users.noreply.github.com> (cherry picked from commit 19c5833)
[v1] Add PrefixLM support to TritonAttention backend (vllm-project#30386 ) (cherry picked from commit 74a1ac3)
[XPU] fix broken fp8 online quantization for XPU platform (vllm-proje… …ct#30831) Signed-off-by: Yan Ma <yan.ma@intel.com> (cherry picked from commit 4f735ba)
[ROCm] [Bugfix] Fix torch sdpa hallucination (vllm-project#30789) Signed-off-by: tjtanaa <tunjian.tan@embeddedllm.com> (cherry picked from commit 2410132)
[Core] Rename PassConfig flags as per RFC vllm-project#27995 (vllm-pr… …oject#29646) Signed-off-by: arpitkh101 <arpit5khandelwal@gmail.com> Co-authored-by: Luka Govedič <ProExpertProg@users.noreply.github.com> (cherry picked from commit d7284a2)
[BugFix] Fix PP/async scheduling with pooling models (vllm-project#28899 ) Signed-off-by: Nick Hill <nhill@redhat.com> Co-authored-by: Cyrus Leung <tlleungac@connect.ust.hk>
PreviousNext