262小时日本儿童语音数据

411人约262小时日本儿童语音数据,收录147,668句朗读语音。话者为6岁至13岁日本儿童,按低年级(6~9岁,179人)和高年级(10~13岁,232人)分类收录,男女比例均衡。采用智能手机录制,音频格式为16kHz/16bit单声道WAV,附发话文字转写及朗读原稿。本数据集可用于日语儿童语音识别(ASR)、语音合成(TTS)、话者识别及发音评估等任务。

数据规格

数据规模
411人 约262小时,147,668句
采集对象
日本儿童(6岁~13岁)
采集设备
智能手机
数据格式
音频数据格式为WAV,转写数据格式为TSV
数据内容
朗读语音 按低年级(6~9岁)和高年级(10~13岁)分类收录标注内容发话文字转写
朗读原稿准确率 字符准确率
98%以上
应用场景
语音识别(ASR)、语音合成(TTS)、话者识别、发音评估