Instructions to use Anadilorg/Anadil_Uyghur_TTS with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- VoxCPM
How to use Anadilorg/Anadil_Uyghur_TTS with VoxCPM:
import soundfile as sf from voxcpm import VoxCPM model = VoxCPM.from_pretrained("Anadilorg/Anadil_Uyghur_TTS") wav = model.generate( text="VoxCPM is an innovative end-to-end TTS model from ModelBest, designed to generate highly expressive speech.", prompt_wav_path=None, # optional: path to a prompt speech for voice cloning prompt_text=None, # optional: reference text cfg_value=2.0, # LM guidance on LocDiT, higher for better adherence to the prompt, but maybe worse inference_timesteps=10, # LocDiT inference timesteps, higher for better result, lower for fast speed normalize=True, # enable external TN tool denoise=True, # enable external Denoise tool retry_badcase=True, # enable retrying mode for some bad cases (unstoppable) retry_badcase_max_times=3, # maximum retrying times retry_badcase_ratio_threshold=6.0, # maximum length restriction for bad case detection (simple but effective), it could be adjusted for slow pace speech ) sf.write("output.wav", wav, 16000) print("saved: output.wav") - Notebooks
- Google Colab
- Kaggle
AnadilUyghurTTS — Uyghur (Uyğurche) Text-to-Speech Modeli
AnadilUyghurTTS, openbmb/VoxCPM2 temel modeli üzerine LoRA (Low-Rank Adaptation) ile ince ayar yapılmış, Uyghur (ISO 639-3: ug) için açık kaynak bir konuşma sentezi (text-to-speech) modelidir. 209.906 segmentlik tek konuşmacılı bir veri setiyle (Mozilla Common Voice 26.0 ug katkısı) eğitilmiştir — "Anadil" ailesinin (Lazca, Zazaca, Adığece, Kurmancî, Ermenice, Ladino, Kırgızca) en büyük eğitim veri setine sahip üyesidir.
AnadilUyghurTTS is an open-source text-to-speech LoRA adapter for Uyghur (ug), fine-tuned on top of VoxCPM2 on 209,906 single-speaker utterances from Mozilla Common Voice 26.0. It is the newest and data-largest member of the "Anadil" family of minority-language TTS adapters, continuing the effort to give low-resource languages a voice in digital tools.
📋 Model Bilgileri
| Özellik | Detay |
|---|---|
| Dil | Uyghur (ug, trainer etiketi uig) |
| Konuşucu | spk_tmp_001 (tek konuşmacı) |
| Temel model | openbmb/VoxCPM2 |
| Yöntem | LoRA (r=32, α=32, LM + DiT katmanları) |
| Eğitim verisi | 209.906 segment — Common Voice 26.0 ug (ailedeki en büyük veri seti) |
| Eğitim adımı | 5.000 |
| Adapter boyutu | ~72 MB (384 tensor, ~18,1M parametre, F32) |
| Sample rate | 48 kHz çıkış |
| Lisans | MIT |
🔊 Örnek Sesler — Orijinal ve Sentez Karşılaştırması
Aşağıda orijinal referans ses (gerçek konuşmacı) ile modelin ürettiği sentez (TTS) arasındaki farkları duyabilirsiniz:
Not: Şeffaflık için belirtelim — bu 5 örnek cümlenin tümü eğitim sırasında modele görülmüş (in-training) cümlelerdir. Otomatik kalite metrikleri (WER vb.) henüz hesaplanmamıştır.
1. بىر نەرسىگە پۈتۈن ۋۇجۇدۇڭ بىلەن بېرىلسەڭ پۈتۈن دۇنيا ساڭا ياردەم بېرىدۇ.
| Orijinal (Gerçek Konuşmacı) | Sentez (Model Çıktısı) |
|---|---|
2. ياخشىنى ماختىساڭ يارىشىدۇ، ياماننى ماختىساڭ ئادىشىدۇ.
| Orijinal (Gerçek Konuşmacı) | Sentez (Model Çıktısı) |
|---|---|
3. ئابدۇقادىر داموللام مەرىپەتپەرۋەر، تەرەققىيپەرۋەر بىر زات ئىدى.
| Orijinal (Gerçek Konuşmacı) | Sentez (Model Çıktısı) |
|---|---|
4. ئۇلار ئىككى يۈرۈش توختام ئىمزالاشتى.
| Orijinal (Gerçek Konuşmacı) | Sentez (Model Çıktısı) |
|---|---|
5. سىز بىلەن تانسا ئوينىغاندا ئېسىمدە بەك قاپتىكەنسىز.
| Orijinal (Gerçek Konuşmacı) | Sentez (Model Çıktısı) |
|---|---|
⚡ Hızlı Başlangıç
Model, hedef konuşmacının referans ses klibi (reference wav) üzerinden ses klonlaması yapar — eğitim konuşucusu için samples/1.wav kullanılabilir, farklı bir ses için kendi wav kaydınızı verin.
pip install torch torchaudio soundfile safetensors numpy voxcpm
git clone https://huggingface.co/Anadilorg/Anadil_Uyghur_TTS
cd Anadil_Uyghur_TTS
# Tek cümle sentezle
python inference.py "مەن ياخشىمەن!" --reference samples/1.wav --out hello.wav
# Repo'daki 5 örnek cümlenin tümünü üret (samples/<n>a.wav)
python inference.py --list-samples
Python API
from inference import AnadilUyghurTTS
tts = AnadilUyghurTTS() # openbmb/VoxCPM2 + bu repo'daki LoRA ağırlıkları
tts.synthesize(
"مەن ياخشىمەن!",
reference_wav="samples/1.wav",
out_path="hello.wav",
cfg_value=2.0,
inference_timesteps=10,
)
Gradio arayüzü (yerel)
pip install gradio
python demo.py # http://localhost:7860
🧪 Doğrulama
python test_smoke.py --weights-only # saniyeler içinde ağırlık bütünlük kontrolü
python test_smoke.py # tam test: temel modeli indirir, Uyghur bir cümle sentezler
⚠️ Kısıtlamalar
- Tek konuşmacı: Model tek bir konuşmacı etiketi (
spk_tmp_001) üzerine eğitilmiştir; farklı sesler referans klip ile sıfır-örnekçi klonlama yoluyla yaklaşılmaya çalışılır. - Kısa eğitim: 5.000 adımlık eğitim (aile standardı); daha uzun eğitimlerle kalite artırımlı olabilir.
- Kalite metrikleri: Henüz otomatik metrikler (WER, UTMOS vb.) raporlanmamıştır; örnekler eğitim içi cümlelerle sınırlıdır.
- Sentez için ~9 GB bellek önerilir (fp32); CUDA tercih edilir, Apple Silicon daha yavaştır.
Citation
@software{anadil-uyghur-tts,
author = {Anadilorg},
title = {AnadilUyghurTTS: An Open-Source Text-to-Speech LoRA Adapter for Uyghur},
url = {https://huggingface.co/Anadilorg/Anadil_Uyghur_TTS},
version = {0.1.0},
year = {2026}
}
Lisans
MIT — ayrıntılar için LICENSE dosyasına bakınız. Eğitim verisi Mozilla Common Voice 26.0 (ug) katkısından gelmektedir; ilgili lisans koşullarını (CC-0) lütfen gözden geçiriniz.
- Downloads last month
- 16
Model tree for Anadilorg/Anadil_Uyghur_TTS
Base model
openbmb/VoxCPM2