K
KoralyxAI

African Language Technologies

Most AI language models are trained predominantly on English and European languages. African languages remain severely underrepresented in AI research and deployment. KoralyxAI is building datasets, models, and evaluation benchmarks for African languages — starting with the languages of the DRC.

Priority Languages

Lingala

Region: DRC, Congo

Speakers: ~10M

Kikongo

Region: DRC, Angola

Speakers: ~8M

Tshiluba

Region: DRC

Speakers: ~8M

Congolese Swahili

Region: DRC, Uganda, Rwanda

Speakers: ~15M

French

Region: DRC, Africa-wide

Speakers:

Research Areas

Natural Language Processing

  • • Language modeling
  • • Text classification
  • • Sentiment analysis
  • • Named entity recognition
  • • Tokenization
  • • Embeddings

Speech AI

  • • Automatic speech recognition
  • • Text-to-speech synthesis
  • • Speech datasets
  • • Accent and dialect recognition
  • • Speaker identification

Translation & Multilingualism

  • • Machine translation
  • • Code-switching
  • • Multilingual models
  • • Language transfer learning
  • • Low-resource NLP techniques

Datasets & Benchmarks

  • • Language corpora
  • • Annotated datasets
  • • Benchmark suites
  • • Evaluation metrics
  • • Open release on Hugging Face

Coming Soon

We are currently building our initial datasets, recruiting student researchers, and establishing partnerships. Check back for:

  • • Lingala speech and text corpora
  • • Kikongo language benchmarks
  • • First language models trained on African data
  • • Published research on low-resource NLP for African languages