430小时藏语全双工自然对话麦克风采集语音数据
藏语全双工自然对话麦克风采集语音数据,基于约三十个常见主题来模拟录制。此数据集标注了文本内容、句时间戳、说话人身份、性别等多种属性,由约400名来自藏族人录制,准确性高,为语音识别相关研究及应用提供了丰富的资源,经多家AI公司验证:有助于模型面对真实世界的多样性时能够表现出色。我们严格遵循数据保护法规和隐私规定,确保数据采集、存储和使用的过程中维护用户的隐私和合法权益,所有数据均遵循GDPR,CCPA,PIPL。
数据规格
样例展示
འེ་བདེན་གི། ད་འུ་གཉིས་ག་ད་བྱུང་བྱུང་འདི་ནས་བསྡད་དང་ནོ་རྒྱལ་ས་ད་བྱུང་པེ་ཅིན་བདོག་གོ་ད་བྱུང་འགྱོ་མ་མྱོང་ཟིག ད་སང་ད་འ་རོ་རྒྱལ་ས་པེ་ཅིན་བདོག་གོ་འགྱོ་རས་འ་རོ བདེན་གི། འུ་གཉིས་འདི་ནས་བསྡད་པས་རྒྱལ་ས་པེ་ཅིན་ལ་འགྲོ་མ་མྱོང་། ད་ཐེངས་རྒྱལ་ས་པེ་ཅིན་ལ་འགྲོ་རྒྱུ་བྱེད།
འོ་ལེ། རྒྱལ་ས་པེ་ཅིན་དེ་སོང་ན་ད་གནམ་བདེ་སྒོ་མོ་ཆེ་ཟོ་ར། ལྕགས་རི་རིང་ངོ་ཟོ་དུ་ཟོ་ཡིན་རྒྱུས་ན་ད་ཡ་མཚན་ཧ་ལས་ནི་རེད་ཟེར་གི་ཡ། འོ་ལེ། རྒྱལ་ས་པེ་ཅིན་དེར་སོང་ན་གནམ་བདེ་སྒོ་མོ་ཆེ་དང་། ལྕགས་རི་རིང་པོ་སོགས་་ཡ་མཚན་ཧ་ལས་པ་རེད་ཟེར་གི་འདུག
ད་བྱུང་འགྱོ་ནི་མེད་དྲ་གོ་ནི་ཡོད་དྲ་ད་ ད་སང་ད་དེ་གཅིག་འགྱོ་ན་འདོད་གི་ཡ འགྲོ་ནི་མེད་ཀྱང་གོ་ནི་ཡོད། ད་ཐེངས་དེར་འགྲོ་འདོད་ཡོད།
འོ་ལེ། དོ་ཚུགས་ད་ཞ་ཡས་ཆ་བོ་དགུན་གནང་བྱིན་ནས་སྐབས་དུ་ཟིག་ག་ད་ ད་གཟའ་མི་གང་གོ་དེ་འགྱོ་ཡ དེ་འཁོར་གི་འགྱོ་ཡ། ཁྱིམ་ཁ་གཉིས་ཡེད་ལ་དུ་གེ་འགྱོ་ཡ། ཉི་མ་ཟིག་ག བདུན་གཅིག་དུ་མོ་ཟིག་ག་རང་རྐང་ང་དུ་རུ་དེར་ཟོ་གཅིག་འཁོར་ར་དང་ང་ འོ་ལེ། དོ་ཚུགས་བྱིས་པ་ཚོ་དགུན་གནང་སྟེར་སྐབས གཟའ་མི་ཚང་མ་དེ་འགྲོ ཁྱིམ་ཁ་གཉིས་སུ་བྱས་དེ་ དེར་བདུན་གཅིག་་གི་བར་དུ་དེར་འཁོར།
ཕྱིར་ར་ཡོང་རས་ད་ཕལ་ཆེར་ལོ་ཚེས་རྒྱོ་ཐུག་འདུག་ཁ་ཟིག་རེད་ཡ ཕྱིར་ལ་ཐོན་དུས་ཕལ་ཆེར་ལོ་གསར་ལ་ཐོན་འདུག་