Yedikule 202M Base

Türkçe metin üzerinde sıfırdan ön eğitilmiş 202 milyon parametreli dil modeli.

Geliştirici Ahmet Karakuş, Marul AI
Model türü Decoder-only Transformer, temel model
Dil Türkçe
Parametre 202.1M
Bağlam 2048 token
Ağırlık biçimi bf16, safetensors
Lisans Yedikule Model Lisansı 2.0
Sürüm 2026

Bu bir temel modeldir. Talimat ayarı yapılmamıştır: sohbet şablonu tanımaz, soru cevaplamaz, kendisine verilen metni istatistiksel olarak devam ettirir.

Sohbet için talimat ayarlı sürüme bakın: MarulAI/Yedikule-202M-Instruct. Kendi alanınıza özel bir model eğitmek istiyorsanız başlangıç noktası olarak bu modeli kullanın.

Kullanım amacı

Bu model iki iş için tasarlandı:

  • İnce ayar başlangıcı. Kendi Türkçe veri kümenizle talimat ayarı, alan uyarlaması veya sürekli eğitim yapabilirsiniz. Lisans buna izin verir, ayrıca izin almanız gerekmez.
  • Araştırma. Türkçe dil modellemesi, tokenizasyon verimliliği ve küçük model davranışı üzerine çalışmalarda kullanılabilir.

Doğrudan son kullanıcıya sunulacak bir asistan olarak tasarlanmadı. O iş için talimat ayarlı sürümü kullanın.

Eğitim

Eğitim adımı 45.000
Görülen token 24.33 milyar
Kaynak corpus 33 milyar token Türkçe
En iyi doğrulama kaybı 3.1257 (yaklaşık 22 perplexity)

Bütçe nedeniyle corpus'un tamamı görülmedi, eğitim 24.33 milyar tokende durduruldu.

Eğitim verisi ve lisansları

Corpus iki kaynaktan derlendi:

CulturaX Türkçe alt kümesi. Corpus'un bir bölümü uonlp/CulturaX kümesinin Türkçe kısmından alındı. Bu küme olduğu gibi kullanılmadı: ayrıca filtrelendi ve derin bir temizlik aşamasından geçirildi.

Marul AI web taraması. Corpus'un kalanı bu proje tarafından toplanan ve temizlenen Türkçe metinden oluşur.

CulturaX'in kendine ait bir lisansı yoktur; kaynaklarının lisanslarını devralır. Kendi belgelerinde geçtiği biçimiyle, lisans koşulları mC4 ve OSCAR kümelerini birebir takip eder. Her ikisi de Common Crawl üzerinden üretilmiştir, dolayısıyla Common Crawl kullanım koşulları da geçerlidir. CulturaX kullanımı ayrıca verinin insanlığa zarar verecek veya kötü niyetli amaçlarla kullanılmamasını şart koşar.

CulturaX belgeleri, kümenin Common Crawl kaynaklı olması nedeniyle kişisel ve hassas bilgi içerebileceğini açıkça belirtir. Corpus üzerinde yapılan filtreleme ve temizlik bu riski azaltmayı hedefler ancak tamamen ortadan kaldırdığı iddia edilemez.

Modeli ticari amaçla kullanmak isteyen taraf, telif hakkı sahibinden izin almanın yanında mC4, OSCAR ve Common Crawl koşullarının kendi kullanım biçimine uygunluğunu ayrıca değerlendirmelidir.

Mimari

Güncel küçük dil modellerinde yaygın olan bileşenlerden kurulu:

  • 24 katman, 768 gizli boyut, 2304 ara boyut
  • Grouped Query Attention: 12 sorgu başlığı, 4 anahtar/değer başlığı, başlık boyutu 64
  • Pre norm RMSNorm, RoPE (theta 10000), SwiGLU
  • QK-Norm, başlık boyutunda, dikkat kararlılığı için
  • Bağlı giriş ve çıkış gömmeleri, 48k sözlükte yaklaşık 37M parametre tasarrufu
  • Hiçbir katmanda bias yok
  • Softmax kararlılığı için z-loss, artık projeksiyonlarda 1/sqrt(2L) ölçekli başlangıç

Mimari model.py içinde tanımlıdır, torch dışında bağımlılığı yoktur.

Tokenizer

Marul 48k Byte-Level BPE, Türkçe için eğitilmiş. NFC normalizasyonu, küçük harfe çevirme yok.

Türkçe sondan eklemeli bir dil olduğu için sözlük ek sınırlarını öğrenecek şekilde kuruldu. Evlerimizdeydiniz altı token, Türkiye'nin başkenti Ankara'dır. sekiz token eder. Ayrıntılı örnekler tokenizer_info.json içindedir.

Özel token kimlikleri:

Token Kimlik
<|endoftext|> 0
<|pad|> 1
<|unk|> 2
<|bos|> 3
<|im_start|> 4
<|im_end|> 5
<|system|> 6
<|user|> 7
<|assistant|> 8

4 ile 8 arasındaki sohbet tokenleri tokenizerda hazır bulunur ancak ön eğitimde neredeyse hiç görülmemiştir. Temel model bunları anlamlı biçimde kullanamaz; talimat ayarı yaparken bu tokenleri kullanabilirsiniz.

Kullanım

pip install torch tokenizers safetensors
import torch
from tokenizers import Tokenizer
from safetensors.torch import load_file

from config import ModelConfig
from model import MarulLLM

cfg = ModelConfig.load("model_config.json")
model = MarulLLM(cfg)
model.load_state_dict({k: v.float() for k, v in load_file("model.safetensors").items()})

device = "cuda" if torch.cuda.is_available() else "cpu"
model.eval().to(device)
if device == "cuda":
    model.to(torch.bfloat16)

tok = Tokenizer.from_file("tokenizer.json")

ids = [cfg.bos_token_id] + tok.encode("Türkiye'nin başkenti", add_special_tokens=False).ids
out = model.generate(
    torch.tensor([ids], device=device),
    max_new_tokens=48, temperature=0.6, top_k=40, top_p=0.88,
    repetition_penalty=1.2, no_repeat_ngram_size=4, min_p=0.05,
)
print(tok.decode(out[0].tolist(), skip_special_tokens=True))

Bu kodun ürettiği örnek çıktı:

Türkiye'nin başkenti Ankara'da, bir alışveriş merkezinde düzenlenen "Hediye"
isimli müzik yarışmasında, dereceye girenlere ödülleri verildi.

Dizinin başına <|bos|> (3) eklemek gerekir, model eğitimde her diziyi böyle görmüştür. Üretim <|endoftext|> (0) tokeninde durur.

Çıktının biçimi tipiktir: model haber ve ansiklopedi metnine benzeyen akıcı Türkçe üretir, ancak içeriği doğrulanmamıştır.

Örnekleme ayarları

Önerilen değerler generation_config.json içindedir:

Ayar Değer
temperature 0.6
top_k 40
top_p 0.88
min_p 0.05
repetition_penalty 1.2
no_repeat_ngram_size 4
max_new_tokens 256

Perplexity 22 civarındaki bir temel modelde tekrara düşme eğilimi yüksek olduğu için tekrar cezası ve n-gram engeli bilinçli olarak yüksek tutuldu. Talimat ayarlı sürümde bu değerler gevşetilmiştir.

Değerlendirme

Yöntem

Çoktan seçmeli görevlerde her seçeneğin log P(seçenek | bağlam) değeri hesaplanır ve en yüksek olan seçilir; lm-evaluation-harness protokolü budur. Üretim yapılmaz, bu yüzden sonuçlar örnekleme ayarlarından bağımsızdır ve birebir tekrarlanabilir.

Kullanılan veri kümeleri: XCOPA-TR için cambridgeltl/xcopa (tr, validation+test), Belebele-TR için facebook/belebele (tur_Latn, test). Perplexity, sekiz düz Türkçe paragraf üzerinde token başına ortalama çapraz entropi olarak ölçüldü.

Görev seçimi bilinçlidir. 202 milyon parametrelik bir model MMLU veya ARC gibi bilgi yoğun ölçütlerde rastgele tahmin seviyesinden anlamlı biçimde ayrılamaz; oradaki bir iki puanlık farklar gürültüdür. Aşağıdaki üç ölçüt, bu boyuttaki bir modelin gerçekten sinyal ürettiği yerlerdir.

Sonuçlar

Ölçüt n Rastgele Base SFT
Perplexity (düz Türkçe metin) 8 metin 17.39 15.23
XCOPA-TR, nedensel çıkarım (acc) 600 50.0 59.5 58.8
Belebele-TR, okuduğunu anlama (acc) 900 25.0 31.2 30.9

Perplexity düşük olan iyidir, diğerlerinde yüksek olan.

Talimat ayarı dil modelleme kalitesini belirgin biçimde iyileştirmiş (perplexity 17.39'dan 15.23'e), buna karşılık çoktan seçmeli görevlerde fark ölçüm hatası sınırları içinde kalmış. Bu beklenen bir sonuçtur: SFT modele yeni bilgi öğretmez, var olan bilgiyi talimat biçiminde kullanmayı öğretir.

Standart liderlik tablosu ölçütleri

Karşılaştırma isteyenler için, OpenLLM Turkish Leaderboard protokolüyle daha önce alınan sonuçlar aşağıdadır. Bu ölçütlerde model rastgele tahmin seviyesindedir ve sonuçlar bir yetenek göstergesi olarak okunmamalıdır.

Ölçüt n Rastgele Base SFT
HellaSwag-TR (acc_norm) 1000 25.0 34.8 34.3
ARC-TR (acc_norm) 1167 25.0 26.9 27.2
MMLU-TR (acc) 1710 25.0 23.7 25.8
TruthfulQA-TR mc1 (acc) 817 21.0 24.8 25.5
GSM8K-TR (5-shot, üretim) 120 0.0 1.7 0.8

Yalnızca HellaSwag rastgele tabanın belirgin üzerindedir. GSM8K'daki sonuç, çok adımlı aritmetiğin bu modelde çalışmadığını doğrular.

Bağlam penceresi 2048 token olduğu için ARC 25-shot ve HellaSwag 10-shot yerine 5-shot çalıştırıldı; 25-shot promptu tek başına bağlamı taşırıyordu. Bu sapma üç koşula da aynı uygulandığı için base ile SFT karşılaştırması iç tutarlılığını korur, ancak sayılar başka modellerin liderlik tablosu skorlarıyla doğrudan kıyaslanamaz.

Sınırlar ve riskler

Model bir temel modeldir, asistan değildir. Talimat takip etmez, soru cevaplamaz, kendisiyle sohbet edilemez.

Ürettiği metin akıcı görünse de olgusal doğruluğu düşüktür ve uydurma bilgi içerir. Aritmetik güvenilir değildir. Büyük bir web corpus'u üzerinde eğitildiği için kaynak metinlerdeki önyargılar, kalıp yargılar ve uygunsuz içerik modele geçmiş olabilir. Doğrudan son kullanıcıya sunulmadan önce talimat ayarı ve güvenlik değerlendirmesi yapılmalıdır.

Dosyalar

Dosya İçerik
model.safetensors bf16 ağırlıklar, 404 MB
model.py model mimarisi
config.py ModelConfig veri sınıfı
model_config.json mimari parametreleri
tokenizer.json Marul 48k Byte-Level BPE
tokenizer_config.json tokenizer meta bilgisi
tokenizer_info.json özel tokenler ve tokenizasyon örnekleri
generation_config.json önerilen örnekleme ayarları
LICENSE.md lisans tam metni

Lisans

Yedikule Model Lisansı 2.0. Telif hakkı sahibi Ahmet Karakuş (Marul AI). Bağlayıcı metin LICENSE.md dosyasındadır.

İzin almadan yapabilecekleriniz: modeli çalıştırmak, eğitim ve araştırmada kullanmak, üzerine ince ayar yapmak, damıtmak, birleştirmek, nicelemek, başka biçimlere çevirmek ve sonucu yayımlamak. Hepsi ticari olmayan kullanımla sınırlıdır.

Uymanız gerekenler: Yedikule'ye atıf yapmak, türev modelinizin adında Yedikule geçirmek, lisansı model ile birlikte dağıtmak ve telif bilgisini korumak.

Türevler de bu lisansa tabidir. Modelden türettiğiniz her çalışma aynı koşullara bağlı kalır; kendi lisansınızla yeniden lisanslayamazsınız. Türev modeli siz eğitmiş olsanız bile ticari kullanımı izne bağlıdır.

Ticari kullanım yazılı izne bağlıdır.

Ticari lisans ve izin talepleri: marulai.resmi@gmail.com (Ahmet Karakuş, Marul AI)

Atıf

Yedikule, 202M parametreli Türkçe dil modeli.
Ahmet Karakuş, Marul AI, 2026.
https://huggingface.co/MarulAI/Yedikule-202M-Base
Downloads last month

-

Downloads are not tracked for this model. How to track
Safetensors
Model size
0.2B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for MarulAI/Yedikule-202M-Base

Finetunes
1 model

Collection including MarulAI/Yedikule-202M-Base