1 篇文章

  • server_profile

    Nsys Profiler Load Model cudamemgetinfo 执行了 373 s,应该是 Orin 的内存探测有问题,可能是其他系统组件影响了这个函数的性能。 使用文件进行 mmap,所以会出现 cudamemasync 之后进行 cuda sync 的情况,导致性能下降。 Forward 也会出现大量的 H2D 拷贝 主要拷贝的不是模型权重,也不是大块 KV cache,而是这些每个 ubatch 都会变化的输入: tokens: 当前 prefill micro-batch 的 token id pos: 每个 token 的 position k_idxs / v_id...