Improving Slovene Language Models for Lexicographic Question Answering through Continued Pretraining and Instruction Fine-Tuning

Timotej Knez, Slavko Zitnik


Abstract
This paper presents a two-stage training approach to improve the performance of Slovene large language models on lexicographic question-answering tasks. We developed a comprehensive lexical pretraining corpus containing 356,294 Slovene word entries. We constructed the corpus by converting structured data from multiple lexicographic sources into markdown format. Additionally, we created a question-answering dataset with 10,485 QA pairs from diverse sources, including automatically generated questions, a linguistic advisory portal, and community forums. Using the Slovenian GaMS model (based on Gemma 2 9B) and GaMS 3 model (based on Gemma 3 12B), we performed continued pretraining on the lexical corpus, followed by instruction fine-tuning with our QA dataset combined with translated general-domain questions. We compared results to different model configurations. Our results demonstrate significant improvements (text similarity increasing from 0.226 to 0.542, BERTScore F1 of 0.915) in answering Slovene lexicographic questions, validating the effectiveness of domain-specific continued pretraining for low-resource languages.
Anthology ID:
2026.slide-1.10
Volume:
Proceedings of the Workshop on Structured Linguistic Data and Evaluation (SLiDE)
Month:
May
Year:
2026
Address:
Palma de Mallorca, Spain
Editors:
Erhard Hinrichs, Joakim Nivre, Petya Osenova, James Pustejovsky, Claus Zinn
Venues:
SLiDE | WS
SIG:
Publisher:
ELRA Language Resources Association (ELRA)
Note:
Pages:
114–123
Language:
External URL:
https://lrec.elra.info/lrec2026-ws-slide-10
DOI:
10.63317/2t3zgpnbv52e
Bibkey:
Cite (ACL):
Timotej Knez and Slavko Zitnik. 2026. Improving Slovene Language Models for Lexicographic Question Answering through Continued Pretraining and Instruction Fine-Tuning. In Proceedings of the Workshop on Structured Linguistic Data and Evaluation (SLiDE), pages 114–123, Palma de Mallorca, Spain. ELRA Language Resources Association (ELRA).
Cite (Informal):
Improving Slovene Language Models for Lexicographic Question Answering through Continued Pretraining and Instruction Fine-Tuning (Knez & Zitnik, SLiDE 2026)
Copy Citation: