登录社区云,与社区用户共同成长
邀请您加入社区
本文详细介绍了华为Atlas200边缘设备的开箱配置指南,从系统基础设置到CANN工具链安装,再到使用Anaconda和MindStudio搭建开发环境,最后完成ONNX模型转换并运行第一个AI模型。文章特别强调了避坑技巧和常见问题解决方案,帮助开发者快速上手昇腾生态。
本文探讨了CANN平台中ops-nn仓库的RNN算子实现与应用。首先介绍了CANN异构计算架构和RNN理论基础,包括标准RNN、LSTM和GRU的结构原理。随后详细解析了ops-nn中的DynamicRNN、BidirectionalLSTM等核心算子,并提供了算子优化策略,如矩阵乘法融合、内存优化和并行化处理。最后通过语音识别等案例展示了RNN算子的实际应用。文章为开发者提供了RNN算子在昇腾A
本文深入解析了CANN项目中ATC工具生成OM模型文件的二进制序列化过程。OM模型作为AI计算架构中的关键环节,采用自定义二进制格式设计,以实现极致性能、硬件优化和自包含特性。文章详细剖析了文件头结构、模型描述序列化和权重数据打包等核心算法实现,展示了OM格式在加载速度上的显著优势。同时提供了使用ATC工具生成OM文件、Python解析工具应用等实战内容,并针对版本兼容性、精度异常等常见问题给出解
本文深入解析了昇腾AI异构计算架构CANN的层次化设计,详细介绍了其五层抽象架构和三层逻辑架构的协同机制。通过实战案例展示了CANN在模型部署、性能优化和多模态处理中的核心价值,帮助开发者高效利用昇腾芯片的异构计算能力,提升AI应用的性能和开发效率。
本文系统阐述了深度学习核心算子矩阵乘法在昇腾NPU上的全链路优化方法。作者基于13年高性能计算经验,详细解析了从数学原理到硬件映射的优化体系,重点介绍了CANN软件栈通过分块策略、流水线并行和内存层级优化将NPU计算单元利用率从25%提升至85%的关键技术。文章包含完整的AscendC MatMul算子实现流程,涵盖基础实现到极致优化的五个阶段,并分享了千亿参数大模型训练中的典型性能陷阱解决方案。