4,720,000 Groups - Chinese-Uighur Parallel Corpus Data

Chinese

Uighur

Han-Uyghur

Parallel corpus

4,720,000 sets of Chinese and Uighur language parallel translation corpus, data storage format is txt document. Data cleaning, desensitization, and quality inspection have been carried out, which can be used as a basic corpus for text data analysis and in fields such as machine translation.

This is a paid datasets for commercial use, research purpose and more. Licensed ready made datasets help jump-start AI projects.

Recommended Dataset

1,140,000 Groups - Chinese - Hebrew Parallel Corpus Data

1.14 Million Pairs of Sentences - Chinese-Hebrew Parallel Corpus Data be stored in text format. It covers multiple fields such as tourism, daily life, news, etc. The data desensitization and quality checking had been done. It can be used as a basic corpus for text data analysis in fields such as machine translation.

Chinese Hebrew Chinese-Hebrew Parallel Corpus

12,820,000 Groups - Chinese-Korean Parallel Corpus Data

12,820,000 sets of parallel translation corpus between China and Korea, which are stored in txt files. It covers many fields including spoken language, traveling, news, and finance. Data cleaning, desensitization, and quality inspection have been carried out. It can be used as the basic corpus database in the text data files as well as used in machine translation.

Chinese Korean Chinese-Korean Parallel Corpus

3,140,000 Groups - Chinese-Spanish Parallel Corpus Data

The 3,140,000 Groups - Chinese-Spanish Parallel Corpus Data is a bilingual texts is stored in text format. All of the data are related to science and technology. average sentence length is 37.1 characters. The data desensitization and quality checking had been done. It can be used as a basic corpus for text data analysis in fields such as machine translation.

Chinese Spanish Sino-Spain Parallel corpus

English-Japanese Parallel Corpus – 850,000 Sentence Pairs for Machine Translation

This dataset contains 850,000 English-Japanese parallel sentences stored in TXT format. It covers multiple fields such as tourism, medical treatment, daily life, news, etc. average English sentence 23 words. The data desensitization and quality checking had been done. It can be used as a fundamental dataset for machine translation, bilingual NLP tasks, and other text processing applications.

English Japanese parallel corpus English Japanese translation dataset English Japanese bilingual corpus English Japanese parallel dataset English Japanese text dataset English Japanese MT dataset

750,000 Groups - Chinese-Burmese Parallel Corpus Data

0.75 Million Pairs of Sentences - Chinese-Burmese Parallel Corpus Data be stored in text format. It covers multiple fields such as tourism, medical treatment, daily life, news, etc. The data desensitization and quality checking had been done. It can be used as a basic corpus for text data analysis in fields such as machine translation.

Chinese Burmese Sino-Myanmar Parallel corpus

7,290,000 Groups -Chinese -Vietnamese Parallel Corpus Data

7.29 Million Pairs of Sentences - Chinese-Vietnamese Parallel Corpus Data be stored in text format. It covers multiple fields such as tourism, medical treatment, daily life, news, etc. The data desensitization and quality checking had been done. It can be used as a basic corpus for text data analysis in fields such as machine translation.

Chinese Vietnamese Chinese-Vietnamese Parallel Corpus

10,030,000 Groups – Chinese-Portuguese Parallel Corpus Data

10.03 Million Pairs of Sentences - Chinese-Portuguese Parallel Corpus Data be stored in text format. It covers multiple fields such as tourism, medical treatment, daily life, news, etc. The data desensitization and quality checking had been done. It can be used as a basic corpus for text data analysis in fields such as machine translation.

Chinese Portuguese Chinese-Portuguese Parallel Corpus

5.3M Pairs German-Chinese Parallel Corpus for NLP and MT Applications

5.3 million Chinese-German parallel sentence pairs stored in text format, covering multiple domains such as tourism, medical treatment, daily life, news, etc. The data desensitization and quality checking had been done. It can be used for machine translation, NLP research, and bilingual text analysis.

german parallel corpus chinese german sentence pairs dataset chinese german bilingual corpus chinese german NLP corpus chinese german text alignment dataset