系列文章目录

精简HaGRID静态手势数据集与数据增强处理——YOLOv8+Medipipe手势识别系统实践记录(一)_hagrid数据集-CSDN博客


目录

        在本系列上期文章中,我们对HaGRID静态手势数据集做了精简处理,并基于Albumentations库执行了离线数据增强操作。本文将租赁云计算平台并搭建部署YOLOv8环境,使用该数据集训练手势识别模型。使用到的云计算平台是矩池云,该平台提供可视化界面,并且提供了搭建好的Pytorch环境,因此部署与训练过程相对简单。使用本文提供的YOLOv8整合包可以执行一键部署,整个训练流程需要约3个小时,成本5-8元。


一、YOLOv8一键部署+数据集整合包

        本次训练所需的资源都整合到了一个压缩包中,包含YOLOv8一键安装包和精简+数据增强的HaGRID静态手势数据集,大家可以自行下载。

链接:https://pan.baidu.com/s/1yM1-iVCgA9XUciv6cHwuVA 
提取码:n6ag

二、租用云计算平台训练

1.环境准备

        本次使用到的云计算平台:矩池AI云 - 专注于人工智能领域的云服务商

        注册时可以填写邀请码:zVLga9gCKi8kzJn,领取优惠券。注册完成后进入右上角工作空间-我的网盘,将第一步下载的压缩包上传至我的网盘。如下图:

        上传完成后,我们需要下载一个可视化的工具——VNC Viewer,用于连接服务器,提供可视化的操作界面,下载连接:Download VNC Viewer by RealVNC®

        具体操作步骤可以参考矩池云官方的远程连接说明,说明当中也有Windows与MacOS的下载链接:VNC Viewer 远程连接矩池云机器教程 - 矩池云支持中心 - 矩池云支持中心

        下载完成后回到主页,进入左上角产品服务-算力-GPU云服务器,如下图所示:

        训练速度与显存大小高度相关,考虑到性价比,建议大家选用RTX3090进行训练,点击租用,按照下图进行设定,选择Pytorch1.11并设置开启VNC:

        下单后回到工作空间-我的实例,可以看到租用机器的详情,在详情的VNC处有VNC链接与密码,如下图所示:

        将链接复制进前文下载好的VNC Viewer,如下图所示:

        在弹出的窗口中输入密码,即可进入可视化的操作界面:

        在桌面创建一个文件夹,之后点击我的网盘,将其中上传好的压缩包放入新建的文件夹,右键点击Extract here解压至当前文件夹中,首次点击可能会没有反应,不要多次重试,等待约1分钟左右就会弹出解压提示。

        之后双击打开PyCharm,将该文件夹拖入PyCharm打开,会弹出提示创建虚拟环境,点击ok:

        点击终端,输入pip install -e .即可一键部署。

2.训练

        关键文件说明如下:

        数据集:

        配置文件:

        在终端输入该命令即可开始训练:

yolo train model=yolov8n.pt data=hands.yaml epochs=100 batch=64

        命令说明如下,可以根据自己需求进行添加或修改,16g显存batch建议设置到56,24g可以设置成64:

yolo train \
    model=yolov8n.pt \          # 预训练模型(n/s/m/l/x 不同尺寸,越大性能需求越高效果越好)
    data=hands.yaml \           # 数据集配置文件
    epochs=100 \                # 训练轮数
    batch=16 \                  # 批大小(根据显存调整)
    imgsz=640 \                 # 输入图像尺寸
    device=0 \                  # 使用 GPU 0
    workers=8 \                 # 数据加载线程数
    optimizer='AdamW' \         # 优化器(可选 SGD/Adam/AdamW)
    lr0=0.001 \                 # 初始学习率
    name='hand_detection_v1' \  # 实验名称(结果保存在 runs/detect/name)
    patience=50 \               # 早停轮数(若精度无提升)
    save_period=10 \            # 每 10 轮保存一次模型
    pretrained=True \           # 加载预训练权重
    cache=True                  # 缓存数据集加速训练(需足够内存)

        训练完成将会在runs文件夹生成模型文件和性能评估文件,将该文件夹放入我的网盘中,即可在本地取出。

        模型的部分性能指标如下:

        模型下载连接:https://pan.baidu.com/s/15sul02HZBiEBkpHHiGnJzA 
        提取码:sh7m


总结

        本文介绍了在云计算平台上使用YOLOv8训练手势识别模型的完整流程。首先提供了一键部署的YOLOv8整合包和精简后的HaGRID手势数据集下载链接。详细说明了在矩池云平台租用GPU服务器(推荐RTX3090)、通过VNCViewer连接可视化界面的步骤,以及解压数据包、配置PyCharm虚拟环境的过程。重点讲解了训练命令的参数设置建议,包括batch大小调整、优化器选择等关键参数,并展示了最终模型训练结果。整个训练过程约3小时,成本5-8元,适合初学者低成本快速训练手势识别模型。

Logo

腾讯云面向开发者汇聚海量精品云计算使用和开发经验,营造开放的云计算技术生态圈。

更多推荐