1. 项目背景与核心挑战
在人工智能计算领域,训推一体(Training-Inference Unified)架构正成为昇腾等高性能计算平台的主流部署方案。这种架构将模型训练和推理任务混合部署在同一套硬件系统上,能够显著提升算力资源利用率。然而,随着大模型参数规模的爆炸式增长,传统内存架构面临严峻的"内存墙"挑战——计算单元的性能提升速度远超内存带宽和容量的增长,导致NPU算力无法得到充分利用。
U3M(Unified 3-Tier Memory)架构作为应对这一挑战的创新方案,通过整合HBM(高带宽内存)、DRAM(动态随机存取内存)和SSD(固态硬盘)三层存储资源,构建了统一的虚拟内存空间。这种架构理论上可以同时满足大模型对高带宽和大容量的双重需求。但在实际应用中,我们发现现有U3M架构存在两个关键瓶颈:
首先是访存预测准确率不足。当前采用的GMT-Reuse策略基于静态状态机和马尔科夫链,在LLAMA3 13B等大模型场景下,访存预测命中率仅为71.09%。这意味着近30%的访存请求需要跨层级获取数据,导致NPU计算单元长时间等待,系统吞吐量大幅下降。
其次是内存分配策略与业务场景适配性差。训练任务通常需要大块连续内存空间来存储模型参数和梯度,而推理任务则频繁访问小块KV Cache(键值缓存)。这种访存模式的显著差异使得静态内存分配策略难以兼顾两者的需求,导致资源利用率低下。
2. 技术方案设计思路
2.1 整体架构设计
我们的解决方案采用"感知-建模-分配"三层递进式架构,在不改变现有硬件设计的前提下,通过软件算法优化实现性能突破。
感知层依托昇腾CANN(Compute Architecture for Neural Networks)工具链,实时采集训练和推理任务的访存轨迹。我们设计了轻量级的探针机制,在几乎不影响系统性能的情况下(额外开销<1%),捕获包括访存地址、数据块大小、时间戳等关键特征,构建标准化的访存特征库。
建模层创新性地融合了双状态机马尔科夫链和轻量级强化学习算法。传统GMT-Reuse策略使用单一状态机,难以适应训推混布场景的动态变化。我们的双状态机设计分别针对训练和推理任务建立独立的访存模式模型,再通过元控制器动态调整两者的权重。
分配层提出基于容算比(Capacity-Computing R
