看了《你需要知道的 AI 内存知识》,我才知道:
- 本地运行大模型的核心资源主要有三个:内存容量、内存带宽和计算算力,三者共同决定模型规模和运行速度。
- 统一内存架构(Unified Memory) 可以让 CPU 和 GPU 共享大容量内存,从而突破传统独立显卡显存容量限制,更容易加载大模型。
- 模型名称中的 MoE(Mixture of Experts,混合专家模型) 表示模型只会激活部分参数进行计算,可以显著降低推理所需的内存和算力。
- 当前消费级设备,即使价格达到数万元,也仍然存在明显限制:要么模型规模受限,要么推理速度不足,实际更适合运行中小型模型或经过优化的 MoE 模型。