跳到主要内容

数据参数

数据集划分

训练集比例默认为 100%,验证集比例默认为 20%。

大量数据的情况

数据量大于 10000 张时,可以适当降低验证集比例,例如设置为 10% 或更低。

如果有 10 个类别且各类别图片数量相近,10 万张图片按 5% 划分验证集,每个类别约有 500 张图片,可用于计算较稳定的评估指标。

少量数据的情况

数据量少于 1000 张时,验证集比例通常设置为 20%。验证集图片过少时,评估指标的变化幅度会较大。

数据极少的情况

样本量低于 10 张且需要查看训练效果时,可以将训练集和验证集都设置为 100%。

数据倍增

训练步数可按以下公式估算:

每轮训练步数(step)≈ 训练集图片数 × 数据倍增次数 ÷ 批量大小(batch_size)

数据量较少时,可以通过数据倍增增加每轮的训练步数。

增大数据倍增次数时,参与训练的数据增强样本量随之增加,训练更加充分;减小数据倍增次数时,样本参与训练的次数减少,训练速度更快。

  • 数据只有 1 张时,数据倍增可以设置为 20。

  • 数据不足 100 张时,数据倍增可以设置为 10。

  • 数据超过 100 张时,数据倍增可以设置为 2~8。

  • 训练曲线趋于稳定后,可以降低数据倍增次数。