/images/avatar.png

vLLM 本地 LLM serving

vLLM 针对的是跑过开源 LLM 的人都遇到过的问题:模型加载到 GPU 后,显存占用高得离谱,但 GPU 利用率却上不去。原因:传统方案把 KV cache 按 request 预分配固定长度的连续显存。但实际生成时,request 长度差异很大,导致大量显存浪费。

vLLM 来自 UC Berkeley 的研究团队,2023 年 6 月发布。他们的核心创新是 PagedAttention——受操作系统分页内存管理启发。

Flutter 性能优化最佳实践

Flutter 性能优化最容易走偏的地方,通常有两个:还没测量就开始优化;只有用户反馈卡了,团队才想起来看性能。对 Flutter 3.41.6 和 Dart 3.11.4 来说,底层原则并没有变:守住帧预算、控制 rebuild 范围、减少无谓的 layout / paint 开销,在真机上测,而不是拿模拟器自我安慰。