PHASE 01
南亚 · 东南亚
100万小时 自然对话数据集
第一期计划投入2000万,完成覆盖南亚、东南亚国家的自然对话数据集,构建跨境多语种真实语音底座。
投入 2000万
PHASE 02
中亚 · 中东
100万小时 高质量语音数据集
第二期构建覆盖中亚、中东地区的高质量语音数据集,打通丝绸之路经济带核心语种与方言覆盖。
PHASE 03
非洲
100万小时 高质量语音数据集
第三期完成覆盖非洲的100万小时高质量语音数据集,覆盖非洲主要语种与地域变体。
PHASE 04
全球其他地区
200万小时 + 多模态图文
第四阶段覆盖其他地区200万小时高质量语音数据集,并同步构建多模态图文数据,实现全语种全模态覆盖。