AndyBlocker
RSS FeedBuilding SNNs, LLMs and GPU kernels at Shanghai AI Laboratory.
最近文章
-
DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression
发布于:8,463 字约 31 分钟DeepSeek V4.1 Flash 的技术报告。
-
Full-bandwidth Transformer
发布于:3,750 字约 14 分钟尝试解决 Tokenizer 信息瓶颈问题的工作,最近在看一些和 Latent 有关的工作。
-
SeeDNorm: Self-Rescaled Dynamic Normalization
发布于:3,002 字约 11 分钟有实验有理论,主要是想把 RMSNorm 丢掉的长度信息用温和的方式补充回去,看起来效果也还可以。实验里面有小模型测试的东西,之后可以学一下他们的 setup。另外里面关于方差的一些分析感觉可以挪用到 AsyncT 上去。
-
Rethinking Attention: Polynomial Alternatives to Softmax in Transformers
发布于:1,706 字约 6 分钟作者认为 softmax 有效是因为它将 Attention 矩阵的 Frobenius 范数控制在了 O (sqrt (N)) 量级,从而稳定了训练,因此提出用多项式激活代替 softmax、在期望意义上实现相似的范数控制。理论推完发现这文章没中,ICLR2026 得分 2222,一下子就不想看下去了。感觉实验和理论都不是很好。
-
AsyncT vllm适配、加速笔记(三)
发布于:2,927 字约 11 分钟最后一篇,主要囊括了 AsyncT 算子最终的 Hopper Specilized 版本算子介绍、一些最终效果的 breakdown,以及对接下来可以做的工作的一些分析。下一步要对训练做些优化了。
-
AsyncT vllm适配、加速笔记(二)
发布于:7,287 字约 29 分钟加速第二篇,主要是在 CUDA Kernel 上做更多的优化,反思之前的 Benchmarking 问题等。
-
AsyncT vllm适配、加速笔记(一)
发布于:3,293 字约 13 分钟笔记的第一部分,主要覆盖了一些 preliminaries,基础的 vllm 接入流程,以及简单的 triton 算子实现和最基础版本的 CUDA 算子实现。
-
Attention Residuals
发布于:8,320 字约 29 分钟Kimi 团队关于 Residual Addition 的扩展。看起来某种意义上算是复杂的拓扑结构,说不定在现在的硬件上会有优势?
-
A Unified View of Attention and Residual Sinks: Outlier-Driven Rescaling is Essential for Transformer Training
发布于:5,673 字约 21 分钟Qwen 团队,分析 LLM 中的 Outliers 是如何产生的、有什么影响。
-
2025
发布于:2,097 字约 8 分钟2025.