vLLM 本地 LLM serving
vLLM 针对的是跑过开源 LLM 的人都遇到过的问题:模型加载到 GPU 后,显存占用高得离谱,但 GPU 利用率却上不去。原因:传统方案把 KV cache 按 request 预分配固定长度的连续显存。但实际生成时,request 长度差异很大,导致大量显存浪费。
vLLM 来自 UC Berkeley 的研究团队,2023 年 6 月发布。他们的核心创新是 PagedAttention——受操作系统分页内存管理启发。
vLLM 针对的是跑过开源 LLM 的人都遇到过的问题:模型加载到 GPU 后,显存占用高得离谱,但 GPU 利用率却上不去。原因:传统方案把 KV cache 按 request 预分配固定长度的连续显存。但实际生成时,request 长度差异很大,导致大量显存浪费。
vLLM 来自 UC Berkeley 的研究团队,2023 年 6 月发布。他们的核心创新是 PagedAttention——受操作系统分页内存管理启发。
2023 年底的 LLM 格局:GPT-4 独占第一档,GPT-3.5 吃中端, 开源模型基本只能做玩具。
2024 年中:Mistral 7B、Phi-3、Gemma 等小模型陆续发布,情况变了。
AppDelegate 类在 iOS 应用的生命周期中扮演着至关重要的角色。它充当入口点和中央协调器,处理应用执行过程中的关键事件和转换。
Flutter 性能优化最容易走偏的地方,通常有两个:还没测量就开始优化;只有用户反馈卡了,团队才想起来看性能。对 Flutter 3.41.6 和 Dart 3.11.4 来说,底层原则并没有变:守住帧预算、控制 rebuild 范围、减少无谓的 layout / paint 开销,在真机上测,而不是拿模拟器自我安慰。
Docker Compose 是一个用于定义和运行多容器 Docker 应用程序的工具。 用来定义服务、网络,以及容器运行所需的环境变量。
使用 Docker Compose,可以在容器中通过多种方式设置环境变量。可以使用 Compose 文件或 CLI。每种方法都受环境变量优先级的约束。