数据参数
数据集划分
训练集比例默认为 100%,验证集比例默认为 20%。
大量数据的情况
数据量大于 10000 张时,可以适当降低验证集比例,例如设置为 10% 或更低。

如果有 10 个类别且各类别图片数量相近,10 万张图片按 5% 划分验证集,每个类别约有 500 张图片,可用于计算较稳定的评估指标。
少量数据的情况
数据量少于 1000 张时,验证集比例通常设置为 20%。验证集图片过少时,评估指标的变化幅度会较大。
数据极少的情况
样本量低于 10 张且需要查看训练效果时,可以将训练集和验证集都设置为 100%。

数据倍增
训练步数可按以下公式估算:
每轮训练步数(step)≈ 训练集图片数 × 数据倍增次数 ÷ 批量大小(batch_size)
数据量较少时,可以通过数据倍增增加每轮的训练步数。
增大数据倍增次数时,参与训练的数据增强样本量随之增加,训练更加充分;减小数据倍增次数时,样本参与训练的次数减少,训练速度更快。
-
数据只有 1 张时,数据倍增可以设置为 20。
-
数据不足 100 张时,数据倍增可以设置为 10。
-
数据超过 100 张时,数据倍增可以设置为 2~8。
-
训练曲线趋于稳定后,可以降低数据倍增次数。