Published October 8, 2025 | Version v1

O'zbek tili matnlarining universal bog'liqlik daraxti korpusiga asoslangan neyron semanatik tahlili

  • 1. Ph.D., yetakchi ilmiy xodim, Mirzo Ulug'bek nomidagi O'zbekiston Milliy universiteti
  • 2. O'zbekiston Milliy universitetining UzUDT loyihasi stajyor-o'quvchisi

Description

O'zbek tili morfologik jihatdan boy qoʻshimchalarga ega boʻlib, gapda ot, fe'l va boshqa soʻz turkumlarining qator qoʻshimchalari orqali ma'no ifodalanadi. Soʻnggi 5 yillikda, oʻzbek tilining rivojlanishiga e'tibor sababli, sezilarli strukturaga egan bo'lgan korpuslar va morfologik vositalar paydo boʻla boshladi, ammo toʻliq annotatsiyalangan bog'liqlik daraxti korpusi va yuqori sifatli semantik parserlash hali ham mavjud emas. Ushbu maqolada, Universal Dependencies (UD) korpusi asosida yaratilgan daraxtlar toʻplamiga tayangan holda Oʻzbek tili matnlarining neyron semantik tahlilini taqdim etamiz. Mazkur korpus 686 ta jumla va 7 950 ta tokenni oʻz ichiga oladi, har bir jumla oʻrtacha 11,6 tokenni tashkil etadi. Biz ikki bosqichli arxitektura – BiLSTM asosidagi kontekstual enkoder va bosh/bog'lovchi (head/dependent) proyeksiyalarini birlashtirgan biaffin funksiyasi bilan ishlaydigan graflarga asoslangan parserni quramiz. Sinovlar UAS/LAS koʻrsatkichlari, gap uzunligi bo'yicha tafsilotlar bilan taqdim etiladi.

Files

22_907-135-138-Matlatipov.pdf

Files (255.2 kB)

Name Size Download all
md5:f27585e90b75284accdde08dc40b46cd
255.2 kB Preview Download

Additional details

References

  • A. Akhundjanova and L. Talamo, "Universal Dependencies Treebank for Uzbek," in Proceedings of the Third Workshop on Resources and Representations for Under-Resourced Languages and Domains (Resourceful 2025), pp. 129–134.
  • Elmurod Kuriyozov, David Vilares, and Carlos Gómez-Rodríguez. 2024. BERTbek: A Pretrained Language Model for Uzbek. In Proceedings of the 3rd Annual Meeting of the Special Interest Group on Under-resourced Languages @ LREC-COLING 2024, pages 33–44, Torino, Italia. ELRA and ICCL.
  • Mansurov, B., Mansurov, A. (2021). UzBERT: pretraining a BERT model for Uzbek. arXiv preprint arXiv:2108.09814.
  • Arofat Akhundjanova, Furkan Akkurt, Bermet Chontaeva, Soudabeh Eslami, and Cagri Coltekin. 2025. Parallel Universal Dependencies Treebanks for Turkic Languages. In Proceedings of the Eighth Workshop on Universal Dependencies (UDW, SyntaxFest 2025), pages 129–136, Ljubljana, Slovenia. Association for Computational Linguistics.
  • Matlatipov, G., Vetulani, Z. (2009). Representation of Uzbek Morphology in Prolog. In: Marciniak, M., Mykowiecka, A. (eds) Aspects of Natural Language Processing. Lecture Notes in Computer Science, vol 5070. Springer, Berlin, Heidelberg. https://doi.org/10.1007/978-3-642-04735-0_4
  • M. S. Sharipov, H. S. Adinaev and E. R. Kuriyozov, "Rule-Based Punctuation Algorithm for the Uzbek Language," 2024 IEEE 25th International Conference of Young Professionals in Electron Devices and Materials (EDM), Altai, Russian Federation, 2024, pp. 2410-2414, doi: 10.1109/EDM61683.2024.10615061.