[随笔]其实人也是一个LLM,也需要KVCache

作者渣B
发布2026/09/26
来源zartbot
阅读原文

最近觉得人也越来越像一个LLM了, 而公众号的这些文章似乎很好的构成了KVCache. 不光自己可以用, 也可以和大家做Prefix-Cache.

起因是最近几年经常同时搞好几个项目, 有CIPU芯片相关的, 也有GPU微架构相关的, 也有大模型架构相关的, 还有一些算法相关的项目. 经常Agent还在写RTL的时候, 又切换一个桌面搞算法.

最近在做一些新的芯片相关的研究, 同时准备花一些时间来仔细分析一下Off-policy的LLM-RL相关的算法, 但几个月没碰过了几乎全忘光了. 比较幸运的是以前随手记录了一个专题:《大模型强化学习》

今天顺手让Agent做了一个网站版挂在github page上, 并且做了一个更简短的summary, 似乎这也算得上某种session compaction了? 链接如下:

https://zartbot.github.io/blog/algo/llm\_rl/

另一方面, 我发现一个好玩的事情. 以前天天叫嚣着需要Lossless RDMA/RoCE的人, 还叫嚣着OpenAI都在用PFC的人似乎都没怎么说话了. 相反整个工业界都在开始show自己Lossy RDMA下的性能, 终于从Lossless转向Lossy了.

  • AMD在Hotchip宣称400Gbps的NIC在1%丢包时可以达到160Gbps, Goodput-ratio 40%
  • 国内某家400Gbps NIC稍微好一些可以到48%

即便是Meta宣称可以在1%丢包时Goodput在86%, 那么也就是说依旧还是有10%的带宽被错误重传了

而CIPU eRDMA在3年前就已经是5%丢包率90%的Goodput了..而如今CIPU下一代的带宽已经超越Nvidia最新的CX9和BlueField-4 2倍达到1.6Tbps了…

我想说的是, 这些都是要做10w卡 ~ 50w卡稳定训练的关键技术, 几年前就在谈, 很多年前就在提一个业务指标:

  • 集合通信能够保证95%以上的Fabric利用率
  • 丢包率5%的时候仍然能够保证90%的Goodput
  • 无需任何交换机的高级特性, 网卡实现多路径和拥塞控制
  • 超大规模(128K QPs)并支持所有QP开启多路径转发能力.
  • 兼容RDMA RC Verbs, 线下RDMA应用无需修改代码即可直接运行.
  • Incast 128打1这样的场景, 每个QP之间的带宽差额最大100Kbps.
  • 完全OS无感知的热迁移
  • 完善的RDMA虚拟化支持

可惜几年过去了, 不知道哪一家真的追上来了. 回想起CIPU2.0在3年前送去流片的时候, 也就是2023年底, 我们就完整的预测到MoE模型会成为主流, 并把All-to-All的incast问题干干净净的解决了, 而时至今日还听说某些平台因为incast触发的PFC带来的各种故障… 真不知道工业界都在干些什么….

是时候好好读读这个专题了 《RDMA》