AnadilUyghurTTS — Uyghur (Uyğurche) Text-to-Speech Modeli

AnadilUyghurTTS, openbmb/VoxCPM2 temel modeli üzerine LoRA (Low-Rank Adaptation) ile ince ayar yapılmış, Uyghur (ISO 639-3: ug) için açık kaynak bir konuşma sentezi (text-to-speech) modelidir. 209.906 segmentlik tek konuşmacılı bir veri setiyle (Mozilla Common Voice 26.0 ug katkısı) eğitilmiştir — "Anadil" ailesinin (Lazca, Zazaca, Adığece, Kurmancî, Ermenice, Ladino, Kırgızca) en büyük eğitim veri setine sahip üyesidir.

AnadilUyghurTTS is an open-source text-to-speech LoRA adapter for Uyghur (ug), fine-tuned on top of VoxCPM2 on 209,906 single-speaker utterances from Mozilla Common Voice 26.0. It is the newest and data-largest member of the "Anadil" family of minority-language TTS adapters, continuing the effort to give low-resource languages a voice in digital tools.

📋 Model Bilgileri

Özellik Detay
Dil Uyghur (ug, trainer etiketi uig)
Konuşucu spk_tmp_001 (tek konuşmacı)
Temel model openbmb/VoxCPM2
Yöntem LoRA (r=32, α=32, LM + DiT katmanları)
Eğitim verisi 209.906 segment — Common Voice 26.0 ug (ailedeki en büyük veri seti)
Eğitim adımı 5.000
Adapter boyutu ~72 MB (384 tensor, ~18,1M parametre, F32)
Sample rate 48 kHz çıkış
Lisans MIT

🔊 Örnek Sesler — Orijinal ve Sentez Karşılaştırması

Aşağıda orijinal referans ses (gerçek konuşmacı) ile modelin ürettiği sentez (TTS) arasındaki farkları duyabilirsiniz:

Not: Şeffaflık için belirtelim — bu 5 örnek cümlenin tümü eğitim sırasında modele görülmüş (in-training) cümlelerdir. Otomatik kalite metrikleri (WER vb.) henüz hesaplanmamıştır.

1. بىر نەرسىگە پۈتۈن ۋۇجۇدۇڭ بىلەن بېرىلسەڭ پۈتۈن دۇنيا ساڭا ياردەم بېرىدۇ.

Orijinal (Gerçek Konuşmacı) Sentez (Model Çıktısı)

2. ياخشىنى ماختىساڭ يارىشىدۇ، ياماننى ماختىساڭ ئادىشىدۇ.

Orijinal (Gerçek Konuşmacı) Sentez (Model Çıktısı)

3. ئابدۇقادىر داموللام مەرىپەتپەرۋەر، تەرەققىيپەرۋەر بىر زات ئىدى.

Orijinal (Gerçek Konuşmacı) Sentez (Model Çıktısı)

4. ئۇلار ئىككى يۈرۈش توختام ئىمزالاشتى.

Orijinal (Gerçek Konuşmacı) Sentez (Model Çıktısı)

5. سىز بىلەن تانسا ئوينىغاندا ئېسىمدە بەك قاپتىكەنسىز.

Orijinal (Gerçek Konuşmacı) Sentez (Model Çıktısı)

⚡ Hızlı Başlangıç

Model, hedef konuşmacının referans ses klibi (reference wav) üzerinden ses klonlaması yapar — eğitim konuşucusu için samples/1.wav kullanılabilir, farklı bir ses için kendi wav kaydınızı verin.

pip install torch torchaudio soundfile safetensors numpy voxcpm
git clone https://huggingface.co/Anadilorg/Anadil_Uyghur_TTS
cd Anadil_Uyghur_TTS

# Tek cümle sentezle
python inference.py "مەن ياخشىمەن!" --reference samples/1.wav --out hello.wav

# Repo'daki 5 örnek cümlenin tümünü üret (samples/<n>a.wav)
python inference.py --list-samples

Python API

from inference import AnadilUyghurTTS

tts = AnadilUyghurTTS()  # openbmb/VoxCPM2 + bu repo'daki LoRA ağırlıkları
tts.synthesize(
    "مەن ياخشىمەن!",
    reference_wav="samples/1.wav",
    out_path="hello.wav",
    cfg_value=2.0,
    inference_timesteps=10,
)

Gradio arayüzü (yerel)

pip install gradio
python demo.py            # http://localhost:7860

🧪 Doğrulama

python test_smoke.py --weights-only   # saniyeler içinde ağırlık bütünlük kontrolü
python test_smoke.py                  # tam test: temel modeli indirir, Uyghur bir cümle sentezler

⚠️ Kısıtlamalar

  • Tek konuşmacı: Model tek bir konuşmacı etiketi (spk_tmp_001) üzerine eğitilmiştir; farklı sesler referans klip ile sıfır-örnekçi klonlama yoluyla yaklaşılmaya çalışılır.
  • Kısa eğitim: 5.000 adımlık eğitim (aile standardı); daha uzun eğitimlerle kalite artırımlı olabilir.
  • Kalite metrikleri: Henüz otomatik metrikler (WER, UTMOS vb.) raporlanmamıştır; örnekler eğitim içi cümlelerle sınırlıdır.
  • Sentez için ~9 GB bellek önerilir (fp32); CUDA tercih edilir, Apple Silicon daha yavaştır.

Citation

@software{anadil-uyghur-tts,
  author = {Anadilorg},
  title = {AnadilUyghurTTS: An Open-Source Text-to-Speech LoRA Adapter for Uyghur},
  url = {https://huggingface.co/Anadilorg/Anadil_Uyghur_TTS},
  version = {0.1.0},
  year = {2026}
}

Lisans

MIT — ayrıntılar için LICENSE dosyasına bakınız. Eğitim verisi Mozilla Common Voice 26.0 (ug) katkısından gelmektedir; ilgili lisans koşullarını (CC-0) lütfen gözden geçiriniz.

Downloads last month
16
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Anadilorg/Anadil_Uyghur_TTS

Base model

openbmb/VoxCPM2
Adapter
(29)
this model