Core Specifications
- Architecture: FastText-based embeddings
- Dimensions: 300-dimensional vector space
- Training Data: Clean Sinhala corpus optimized for linguistic accuracy
- Vocabulary: ~500k Comprehensive coverage of Sinhala lexicon
Key Capabilities
Word Embeddings
Generate dense vector representations for individual Sinhala words
Sentence Embeddings
Create contextual embeddings for full Sinhala sentences
Semantic Search
Find semantically similar words and phrases
Similarity Analysis
Compute cosine similarity between text elements
Document Processing
Semantic search in Documents (.txt, .csv, .tsv)
Language-Specific Optimization
- Trained exclusively on high-quality Sinhala text Corpus. Dataset available at Huggingface: CleanSinhalaTextCorpus
- Optimized for Sinhala’s grammatical structures
- Handles Sinhala compound words and morphology effectively

