ترجمه ماشینی مبتنی بر مدل مبدل برای گویش‌های لری بویراحمدی و یزدی به فارسی معیار و گسترش منابع زبانی رایانشی مرتبط

بهمنی, زهرا; میربیگی, محدثه; هاشمی دیجوجین, نگین; نوری, مرضیه; امانی, مهسا; عسگری, احسان الدین; سلیمانی باغشاه, مهدیه; بیگی, حمید; موقر, علی; مقیمی, افضل

doi:10.30465/lsi.2024.43456.1640

ترجمه ماشینی مبتنی بر مدل مبدل برای گویش‌های لری بویراحمدی و یزدی به فارسی معیار و گسترش منابع زبانی رایانشی مرتبط

نوع مقاله : علمی-پژوهشی

نویسندگان

زهرا بهمنی ¹

محدثه میربیگی ²

نگین هاشمی دیجوجین ³

مرضیه نوری ⁴

مهسا امانی ⁵

احسان الدین عسگری ⁶

مهدیه سلیمانی باغشاه ⁷

حمید بیگی ⁷

علی موقر ⁸

افضل مقیمی ⁹

¹ 1PhD. Student, Department of Computer Engineering, Sharif University of Technology, AI Group

² دانشجوی دکتری، دانشگاه صنعتی شریف، دانشکده مهندسی کامپیوتر، گروه هوش مصنوعی

³ دانشجوی کارشناسی ارشد، دانشگاه صنعتی شریف، دانشکده مهندسی کامپیوتر، گروه هوش مصنوعی

⁴ پژوهشگر، دانشگاه صنعتی شریف، آزمایشگاه پردازش هوشمند متن و زبان، گروه هوش مصنوعی

⁵ دانشجوی کارشناسی، دانشگاه صنعتی شریف، دانشکده مهندسی کامپیوتر، گروه هوش مصنوعی

⁶ آزمایشگاه پردازش هوشمند متن و زبان و علوم انسانی محاسباتی

⁷ دانشیار، دانشگاه صنعتی شریف، دانشکده مهندسی کامپیوتر، گروه هوش مصنوعی

⁸ استاد، دانشگاه صنعتی شریف، دانشکده مهندسی کامپیوتر، گروه هوش مصنوعی

⁹ سایر

10.30465/lsi.2024.43456.1640

چکیده

با وجود تلاش‌های گسترده رایانشی بر روی گویش معیار فارسی، سایر لهجه‌ها و گویش‌ها و زبان‌های ایرانی کمتر مورد توجه محققین حوزه زبان‌شناسی رایانشی قرار گرفته‌اند. یکی از مهم‌ترین چالش‌های کار رایانشی بر روی این تمایز‌های زبانی، نبود یک مجموعه داده دیجیتال و استاندارد است. در این پژوهش اولین مجموعه داده تک‌زبانه و نیز داده موازی بر روی گویش‌های لری و یزدی که گویش‌هایی با منابع محدود محسوب می‌شوند، در مقابل فارسی معیار ارائه شده‌ است. در ادامه مدل‌های یادگیری ژرف ترجمه ماشینی کدگذار-کدگشا در دو نوع مدل شبکه عصبی بازگشتی و مدل ژرف مبدل برای این گویش‌ها به فارسی معیار توسعه یافته و ارزیابی گردیده است. در این پژوهش که اولین تلاش محاسباتی روی این دو گویش محسوب می‌شود، برای ترجمه لری به فارسی و فارسی به لری به امتیاز BLEU به ترتیب ۳۹/7 و 29/3 رسیدیم. این امتیاز برای گویش یزدی به فارسی معیار و برعکس به 73/0 و 77/0 رسید. که نشان می‌دهند پژوهش‌های فراتری برای توسعه منابع زبانی برای این زبان نیاز است.

کلیدواژه‌ها

پردازش زبان طبیعی

گویش لری

گویش یزدی

ترجمه تمایزهای زبانی ایرانی

مدل یادگیری ژرف ترجمه ماشینی

عنوان مقاله English

Linguistic Resources and Transformer-based Models for the Machine Translations between Luri and Yazdi Dialects versus Standard Persian

نویسندگان English

Zahra Bahmani ¹

Mohaddeseh Mirbeygi ²

Negin Hashemi Dijujin ³

Marzieh Nouri ⁴

Mahsa Amani ⁵

Ehsan Asgari ⁶

Mahdieh Soleymani Baghshah ⁷

Hamid Beigy ⁷

Ali Movaghar ⁸

Afzal Moghimi ⁹

¹ دانشجوی دکتری، دانشگاه صنعتی شریف، دانشکده مهندسی کامپیوتر، گروه هوش مصنوعی

² PhD. Student, Department of Computer Engineering, Sharif University of Technology, AI Group

³ Msc. Student, Department of Computer Engineering, Sharif University of Technology, AI Group

⁴ Research Assistant, Language Processing and Digital Humanities Lab. , Sharif University of Technology

⁵ Bsc. Student, Department of Computer Engineering, Sharif University of Technology, AI Group

⁶ Qatar Computing Research Institute Engineering,

⁷ Associate Professor, Department of Computer Engineering, Sharif University of Technology, AI Group

⁸ Professor, Department of Computer Engineering, Sharif University of Technology, AI Group

⁹ Other

چکیده English

Despite recent advances in developing language technologies for the standard Persian dialect, the official Iranian language, a large number of Iranian language variations remained computationally unexplored. Iranian languages, e.g., Kurdi, Azeri, and many Persian dialects are examples of low-resource language distinctions lacking significant linguistic resources such as machine-readable lexicons or part-of-speech (POS) taggers. Efforts in developing language technologies for such languages can significantly contribute to language survival in the digital era and promote cultural diversity. To the best of our knowledge, for the first time, we created linguistic resources for the Luri and the Yazdi dialects by introducing the first parallel corpora between these language variations and the modern Persian language. In this study, we train neural encoder-decoders (1) recurrent sequence-to-sequence and (2) transformer-based machine translation models and evaluate the trained model using BLEU score on an unseen test dataset.
Availability of datasets and models: Datasets are available here at https://github.com/language-ml/dataset_yazdi_luri.git

کلیدواژه‌ها English

Natural language processing

Luri dialects

Yazdi dialect

Translations of Persian languages

Deep neural translation

دوره 19، شماره 37
اسفند 1402
صفحه 153-172

XML

اصل مقاله 1.24 M

تعداد مشاهده مقاله	669
تعداد دریافت فایل اصل مقاله	491

ترجمه ماشینی مبتنی بر مدل مبدل برای گویش‌های لری بویراحمدی و یزدی به فارسی معیار و گسترش منابع زبانی رایانشی مرتبط

Linguistic Resources and Transformer-based Models for the Machine Translations between Luri and Yazdi Dialects versus Standard Persian

دوره 19، شماره 37اسفند 1402صفحه 153-172

فایل ها

هم رسانی

ارجاع به این مقاله

آمار

دوره 19، شماره 37
اسفند 1402
صفحه 153-172