登录社区云,与社区用户共同成长
邀请您加入社区
本文详细介绍了在Atlas200边缘计算设备上部署YOLOv8分割模型的完整流程,涵盖从PyTorch(.pt)到昇腾(.om)的模型转换、环境配置和性能优化。通过CANN工具包和MindStudio的支持,开发者可以高效实现AI模型在昇腾平台的部署,显著提升实时推理性能。
本文详细介绍了AI模型从MindSpore训练到昇腾平台部署的完整流程,包括模型导出与格式转换、优化技巧、AscendCL接口应用及性能调优。特别针对昇腾硬件特性,提供了实战中的常见问题解决方案和性能优化策略,帮助开发者充分发挥Ascend平台的AI计算潜力。
本文详细介绍了如何使用ATC工具将ONNX模型高效部署到昇腾Ascend 310P3推理卡上。从模型转换的必要性、环境准备、ONNX模型预处理到ATC转换实战和性能优化技巧,全面解析了在达芬奇架构NPU上实现高性能推理的关键步骤。特别针对动态Shape处理、算子调优和内存复用等场景提供了实用解决方案,帮助开发者充分发挥Ascend 310P3的硬件潜力。
本文详细介绍了在昇腾Altas平台上部署Groundingdino多模态模型的实战经验,涵盖模型转换、算子调优和性能优化等关键步骤。针对复杂模型在异构计算平台上的部署挑战,提供了环境搭建、ONNX模型修改、ATC转换命令详解及性能调优技巧,帮助开发者高效解决部署过程中的常见问题。
本文深入解析了昇腾AI异构计算架构CANN的层次化设计,详细介绍了其五层抽象架构和三层逻辑架构的协同机制。通过实战案例展示了CANN在模型部署、性能优化和多模态处理中的核心价值,帮助开发者高效利用昇腾芯片的异构计算能力,提升AI应用的性能和开发效率。
工具选对,事半功倍:在鲲鹏平台上,坚决首选的组合。对于计算密集型任务,不要尝试手写基础算法,库函数的优化是汇编级别的。关注 NUMA:鲲鹏 HPC 开发必须具备 NUMA 亲和性意识。在运行脚本中加入numactl或正确设置 OMP 环境变量是性能稳定的关键。对齐内存:在进行大规模数组分配时,使用替代malloc,确保地址对齐,配合编译器的向量化指令。在掌握了基础技术栈后,在后面的探索中我们可以学
本文系统阐述了深度学习核心算子矩阵乘法在昇腾NPU上的全链路优化方法。作者基于13年高性能计算经验,详细解析了从数学原理到硬件映射的优化体系,重点介绍了CANN软件栈通过分块策略、流水线并行和内存层级优化将NPU计算单元利用率从25%提升至85%的关键技术。文章包含完整的AscendC MatMul算子实现流程,涵盖基础实现到极致优化的五个阶段,并分享了千亿参数大模型训练中的典型性能陷阱解决方案。
本文介绍将TensorFlow网络模型迁移到昇腾AI平台,并执行训练的全流程。然后以TensorFlow 1.15训练脚本为例,详细介绍了自动迁移、手工迁移以及模型训练的操作步骤。
在Ascend上运行vllm测试