标签: vllm
所有带有此标签的文章 "vllm".
-
AsyncT vllm适配、加速笔记(三)
发布于:2,927 字约 11 分钟最后一篇,主要囊括了 AsyncT 算子最终的 Hopper Specilized 版本算子介绍、一些最终效果的 breakdown,以及对接下来可以做的工作的一些分析。下一步要对训练做些优化了。
-
AsyncT vllm适配、加速笔记(二)
发布于:7,287 字约 29 分钟加速第二篇,主要是在 CUDA Kernel 上做更多的优化,反思之前的 Benchmarking 问题等。
-
AsyncT vllm适配、加速笔记(一)
发布于:3,293 字约 13 分钟笔记的第一部分,主要覆盖了一些 preliminaries,基础的 vllm 接入流程,以及简单的 triton 算子实现和最基础版本的 CUDA 算子实现。