轻量级大模型推理加速框架,依托算子融合、内存复用等优化技术,支持英伟达及主流国产GPU部署,可降低大模型推理延迟与显存占用,开箱即用适配主流深度学习模型。
dsh plugin --profile web add github:uckkk/dsh-hafnium
git clone https://github.com/uckkk/dsh-hafnium.git
git clone git@github.com:uckkk/dsh-hafnium.git
纯 Node 实现,无网络依赖。
dsh plugin add github:uckkk/dsh-hafnium