DiaLEX – Lebanese Arabic (DiaLEX-LA) 
View resource name in all available languages
DiaLEX – Arabe libanais (DiaLEX-LA)
ID:
ELRA-L0211
The Lebanese Arabic Full-Form Lexicon (DiaLEX-LA) is a comprehensive computational lexicon covering the Lebanese Arabic dialect. Featuring approximately 18,000,000 forms for 20,000 lemmas, this full-form lexicon provides exhaustive treatment of all inflected forms.
DiaLEX-LA has several features that make it ideally suited to support natural language processing applications for Lebanese Arabic, especially morphological analysis and speech technology, including:
1. Extremely comprehensive coverage – approximately 18 million entries
2. Comprehensive treatment of all inflected forms, enclitics, proclitics, declensions, and conjugated forms.
3. Full and accurate diacriticization (vocalization), essential for speech technology.
4. Extensive coverage of variants which is necessary since dialects don't have a standard orthography.
Please note: Phonetic transcriptions, IPA and/or SAMPA, fine-tuned to the licensor’s specifications, are available upon request.
Quantity and size: 18,134,187 lines / 2,390 MB (2.3 GB)
File format: flat TSV text files
Samples and a specifications document are available upon request.
View resource description in
French
Ce lexique complet comprend les formes entières du vocabulaire général couvrant le dialecte arabe libanais (DiaLEX-LA). Avec environ 18,000,000 formes pour 20,000 lemmes, ce lexique présente un traitement exhaustif de toutes les formes fléchies.
DiaLEX-LA offre plusieurs éléments qui en font un lexique idéal pour les applications de traitement automatique des langues pour l’arabe libanais, tout particulièrement pour l’analyse morphologique et les technologies vocales. Notamment, il contient :
1. Une couverture extrêmement complète - plus de 18 millions d’entrées
2. Un traitement intégral de toutes les formes fléchies, enclitiques, proclitiques, déclinaisons et formes conjuguées.
3. Une diacritisation complète et précise (vocalisation), essentielle pour les technologies vocales.
4. Une large couverture de variantes, nécessaire pour les dialectes ne présentant pas d’orthographe standardisée.
Remarque : les transcriptions phonétiques en IPA et/ou SAMPA peuvent être fournies, en les affinant selon les spécifications du client, à la demande.
Quantité et taille: 18,134,187 lignes / 2,390 Mo (2.3 Go)
Format de fichier: fichiers textes simples au format TSV
Des échantillons et document de spécifications sont disponibles à la demande.
| MEMBER | academic | commercial |
|---|---|---|
| Licence: Non Commercial Use - ELRA END USER |
11700.00 €
![]() |
19500.00 €
![]() |
| Licence: Commercial Use - ELRA VAR |
23400.00 €
![]() |
39000.00 €
![]() |
| NON MEMBER | academic | commercial |
|---|---|---|
| Licence: Non Commercial Use - ELRA END USER |
14625.00 €
![]() |
24375.00 €
![]() |
| Licence: Commercial Use - ELRA VAR |
29250.00 €
![]() |
48750.00 €
![]() |
Home