TÜRKÇENİN TOKEN DURUMU

Author :  

Year-Number: 2026-59
Language : Türkçe
Subject : Türkçe Eğitimi
Number of pages: 408-424
Mendeley EndNote Alıntı Yap

Abstract

Bu araştırma, Türkçenin büyük dil modelleri karşısındaki token durumunu incelemektedir. Günümüz büyük dil modellerinin temelini oluşturan transformer mimarisi ve buna dayalı BPE tabanlı tokenleştirme sistemleri, veri setlerinin İngilizce ağırlıklı olması nedeniyle doğrudan İngilizce dil yapısına göre optimize edilmiştir. Bu durum, Türkçe gibi eklemeli ve zengin morfolojiye sahip dillerin aynı içerik için önemli ölçüde daha fazla token harcamasına, dolayısıyla daha yüksek işlem maliyetine katlanmasına yol açmaktadır. Araştırmada, dünya dillerinin yapısal sınıflandırması (yalınlayan, bağlantılı, bükümlü) temel alınarak Türkçenin bu sınıflandırmadaki konumu ile tokenleştirme yöntemleri arasındaki ilişki ortaya konmuştur. Çalışma kapsamında karakter temelli, BPE temelli, WordPiece temelli, morfoloji temelli ve kelime temelli olmak üzere beş temel tokenleştirme yöntemi karşılaştırılmıştır. Her yöntemin hangi dil yapılarıyla uyumlu olduğu örnek kelime ve cümleler üzerinden gösterilmiştir. OpenAI'ın tiktoken kütüphanesi (Sürüm 0.13.0) kullanılarak GPT-4o'nun o200k_base ve GPT-4/GPT-3.5 turbo'nun cl100k_base kodlayıcılarıyla yapılan ölçümler, Türkçe cümlelerin İngilizce eşdeğerlerine kıyasla belirgin biçimde daha fazla token gerektirdiğini göstermiştir. Ayrıca Latin, Arap ve Kiril alfabeleriyle yazılan aynı Türkçe kelimelerin bayt büyüklüğü ve token sayısı bakımından farklılaştığı, özellikle Türkçeye özgü seslerin (ö, ü, ç, ğ) bu farkı derinleştirdiği tespit edilmiştir. Alanyazınında BERTurk, ITU TurkBERT, Zemberek, füzyon mimarisi ve TurkishTokenizer çalışmaları incelenmiştir. Araştırmanın sonucunda Türkçe için en uygun yöntemin, doğal dil işleme sözlüğü mevcut olduğunda morfoloji temelli, mevcut olmadığında ise WordPiece temelli tokenleştirmenin veya kök-ek yapısına duyarlı model mimarilerinin yaygınlaştırılması olduğu ortaya koyulmuştur.

Keywords

Abstract

This research examines the token status of Turkish in the face of large language models. The transformer architecture underlying today's large language models, along with the BPE-based tokenization systems built upon it, has been optimized directly for the structure of English, as training datasets are predominantly English-based. This causes agglutinative, morphologically rich languages such as Turkish to consume significantly more tokens for the same content, thereby incurring higher processing costs. Building on the structural classification of world languages (isolating, agglutinative, polysynthetic, and inflectional), the study establishes the relationship between Turkish's position within this classification and various tokenization methods. Five fundamental tokenization methods— character-based, BPE-based, WordPiece-based, morphology-based, and word-based—are compared within the scope of the study, with the compatibility of each method to specific language structures demonstrated through sample words and sentences. Measurements conducted using OpenAI's tiktoken library (Version 0.13.0), employing GPT-4o's o200k_base encoder and GPT-4/GPT-3.5 turbo's cl100k_base encoder, show that Turkish sentences require markedly more tokens than their English equivalents. Furthermore, identical Turkish words written in Latin, Arabic, and Cyrillic alphabets are found to differ in byte size and token count, with sounds specific to Turkish (ö, ü, ç, ğ) deepening this discrepancy. Studies on BERTurk, ITU TurkBERT, Zemberek, fusion architecture, and TurkishTokenizer are reviewed in the literature. The findings indicate that the most suitable approach for Turkish is morphology-based tokenization where a natural language processing dictionary is available, or, in its absence, the wider adoption of WordPiece-based tokenization or model architectures sensitive to root-affix structure.

Keywords

Token, tokenization methods, Turkish


                                                                                                                                                                                                        
  • Article Statistics