aufklarer commited on
Commit
fd378a4
·
0 Parent(s):

Add ASR pipeline metadata

Browse files
.gitattributes ADDED
@@ -0,0 +1,36 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ *.7z filter=lfs diff=lfs merge=lfs -text
2
+ *.arrow filter=lfs diff=lfs merge=lfs -text
3
+ *.bin filter=lfs diff=lfs merge=lfs -text
4
+ *.bz2 filter=lfs diff=lfs merge=lfs -text
5
+ *.ckpt filter=lfs diff=lfs merge=lfs -text
6
+ *.ftz filter=lfs diff=lfs merge=lfs -text
7
+ *.gz filter=lfs diff=lfs merge=lfs -text
8
+ *.h5 filter=lfs diff=lfs merge=lfs -text
9
+ *.joblib filter=lfs diff=lfs merge=lfs -text
10
+ *.lfs.* filter=lfs diff=lfs merge=lfs -text
11
+ *.mlmodel filter=lfs diff=lfs merge=lfs -text
12
+ *.model filter=lfs diff=lfs merge=lfs -text
13
+ *.msgpack filter=lfs diff=lfs merge=lfs -text
14
+ *.npy filter=lfs diff=lfs merge=lfs -text
15
+ *.npz filter=lfs diff=lfs merge=lfs -text
16
+ *.onnx filter=lfs diff=lfs merge=lfs -text
17
+ *.ot filter=lfs diff=lfs merge=lfs -text
18
+ *.parquet filter=lfs diff=lfs merge=lfs -text
19
+ *.pb filter=lfs diff=lfs merge=lfs -text
20
+ *.pickle filter=lfs diff=lfs merge=lfs -text
21
+ *.pkl filter=lfs diff=lfs merge=lfs -text
22
+ *.pt filter=lfs diff=lfs merge=lfs -text
23
+ *.pth filter=lfs diff=lfs merge=lfs -text
24
+ *.rar filter=lfs diff=lfs merge=lfs -text
25
+ *.safetensors filter=lfs diff=lfs merge=lfs -text
26
+ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
27
+ *.tar.* filter=lfs diff=lfs merge=lfs -text
28
+ *.tar filter=lfs diff=lfs merge=lfs -text
29
+ *.tflite filter=lfs diff=lfs merge=lfs -text
30
+ *.tgz filter=lfs diff=lfs merge=lfs -text
31
+ *.wasm filter=lfs diff=lfs merge=lfs -text
32
+ *.xz filter=lfs diff=lfs merge=lfs -text
33
+ *.zip filter=lfs diff=lfs merge=lfs -text
34
+ *.zst filter=lfs diff=lfs merge=lfs -text
35
+ *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ tekken.json filter=lfs diff=lfs merge=lfs -text
README.md ADDED
@@ -0,0 +1,84 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ license: apache-2.0
3
+ language:
4
+ - en
5
+ - fr
6
+ - de
7
+ - es
8
+ - it
9
+ - pt
10
+ - nl
11
+ - hi
12
+ base_model: mistralai/Voxtral-Mini-3B-2507
13
+ library_name: mlx
14
+ pipeline_tag: automatic-speech-recognition
15
+ tags:
16
+ - mlx
17
+ - speech-recognition
18
+ - automatic-speech-recognition
19
+ ---
20
+
21
+ # Voxtral Mini 3B 2507 — MLX 8-bit affine
22
+
23
+ MLX weights for [Voxtral Mini 3B 2507](https://huggingface.co/mistralai/Voxtral-Mini-3B-2507),
24
+ ready for local speech-to-text with
25
+ [speech-swift](https://github.com/soniqo/speech-swift).
26
+
27
+ The FP16, INT5, and INT8 family passed the isolated WER, RTF, throughput, RSS, and physical-footprint compatibility gate on 2026-07-22 using English FLEURS.
28
+
29
+ | Parameters | Precision | Sample rate | Languages |
30
+ |---:|---:|---:|---:|
31
+ | 3B | 8-bit affine | 16 kHz | 8 |
32
+
33
+ ## Files
34
+
35
+ | File | Description |
36
+ |---|---|
37
+ | `model*.safetensors` | MLX model weights |
38
+ | `config.json` and `params.json` | Model and runtime configuration |
39
+ | `tekken.json` | Tekken tokenizer data |
40
+
41
+ ## Usage
42
+
43
+ ```bash
44
+ speech transcribe recording.wav --engine voxtral --model int8
45
+ ```
46
+
47
+ ```swift
48
+ import VoxtralASR
49
+
50
+ let model = try await VoxtralModel.load(
51
+ "aufklarer/Voxtral-Mini-3B-2507-MLX-8bit"
52
+ )
53
+ let text = model.transcribe(
54
+ audio: samples,
55
+ sampleRate: sourceSampleRate,
56
+ language: "en"
57
+ )
58
+ ```
59
+
60
+ ## Benchmark
61
+
62
+ English FLEURS read speech, 80 utterances (759.56 seconds), Apple M5 Pro:
63
+
64
+ | Variant | Bundle | WER | Mean RTF | Peak RSS |
65
+ |---|---:|---:|---:|---:|
66
+ | FP16 | 8.71 GiB | 4.633% | 0.1305 | 9,091 MiB |
67
+ | INT5 | 3.77 GiB | 4.744% | 0.0739 | 4,035 MiB |
68
+ | INT8 | 5.18 GiB | 4.578% | 0.0906 | 5,487 MiB |
69
+
70
+ These read-speech measurements are not Artificial Analysis Conversational or
71
+ ElevenLabs Scribe results.
72
+
73
+ ## Source and license
74
+
75
+ The base model is [mistralai/Voxtral-Mini-3B-2507](https://huggingface.co/mistralai/Voxtral-Mini-3B-2507) and is
76
+ released under Apache 2.0.
77
+
78
+ ## Links
79
+
80
+ - [Voxtral guide](https://soniqo.audio/guides/voxtral)
81
+ - [speech-swift](https://github.com/soniqo/speech-swift)
82
+ - [Soniqo documentation](https://soniqo.audio/getting-started)
83
+ - [Soniqo](https://soniqo.audio)
84
+ - [Blog](https://soniqo.audio/blog)
config.json ADDED
@@ -0,0 +1,63 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "VoxtralForConditionalGeneration"
4
+ ],
5
+ "audio_config": {
6
+ "activation_dropout": 0.0,
7
+ "activation_function": "gelu",
8
+ "attention_dropout": 0.0,
9
+ "dropout": 0.0,
10
+ "head_dim": 64,
11
+ "hidden_size": 1280,
12
+ "initializer_range": 0.02,
13
+ "intermediate_size": 5120,
14
+ "layerdrop": 0.0,
15
+ "max_source_positions": 1500,
16
+ "model_type": "voxtral_encoder",
17
+ "num_attention_heads": 20,
18
+ "num_hidden_layers": 32,
19
+ "num_key_value_heads": 20,
20
+ "num_mel_bins": 128,
21
+ "scale_embedding": false,
22
+ "vocab_size": 51866
23
+ },
24
+ "audio_token_id": 24,
25
+ "hidden_size": 3072,
26
+ "model_type": "voxtral",
27
+ "projector_hidden_act": "gelu",
28
+ "quantization": {
29
+ "group_size": 64,
30
+ "bits": 8,
31
+ "mode": "affine"
32
+ },
33
+ "quantization_config": {
34
+ "group_size": 64,
35
+ "bits": 8,
36
+ "mode": "affine"
37
+ },
38
+ "text_config": {
39
+ "attention_bias": false,
40
+ "attention_dropout": 0.0,
41
+ "head_dim": 128,
42
+ "hidden_act": "silu",
43
+ "hidden_size": 3072,
44
+ "initializer_range": 0.02,
45
+ "intermediate_size": 8192,
46
+ "max_position_embeddings": 131072,
47
+ "mlp_bias": false,
48
+ "model_type": "llama",
49
+ "num_attention_heads": 32,
50
+ "num_hidden_layers": 30,
51
+ "num_key_value_heads": 8,
52
+ "pretraining_tp": 1,
53
+ "rms_norm_eps": 1e-05,
54
+ "rope_scaling": null,
55
+ "rope_theta": 100000000.0,
56
+ "sliding_window": null,
57
+ "use_cache": true,
58
+ "vocab_size": 131072
59
+ },
60
+ "torch_dtype": "bfloat16",
61
+ "transformers_version": "4.54.0.dev0",
62
+ "vocab_size": 131072
63
+ }
generation_config.json ADDED
@@ -0,0 +1,6 @@
 
 
 
 
 
 
 
1
+ {
2
+ "bos_token_id": 1,
3
+ "eos_token_id": 2,
4
+ "pad_token_id": 11,
5
+ "transformers_version": "4.54.0.dev0"
6
+ }
model-00001-of-00002.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d497498404c4717e4be6f04b65ed5ab88c17ea08a4671c21dcf00f0f8a2d0f54
3
+ size 5368741916
model-00002-of-00002.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:cdf722bf98262d6e310eb5ef92e562b415d557dc037b4e317c1b096c534b64fc
3
+ size 197276087
model.safetensors.index.json ADDED
The diff for this file is too large to render. See raw diff
 
params.json ADDED
@@ -0,0 +1,34 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "dim": 3072,
3
+ "n_layers": 30,
4
+ "head_dim": 128,
5
+ "hidden_dim": 8192,
6
+ "n_heads": 32,
7
+ "n_kv_heads": 8,
8
+ "rope_theta": 100000000.0,
9
+ "norm_eps": 1e-05,
10
+ "vocab_size": 131072,
11
+ "max_position_embeddings": 32768,
12
+ "multimodal": {
13
+ "whisper_model_args": {
14
+ "encoder_args": {
15
+ "dim": 1280,
16
+ "n_layers": 32,
17
+ "head_dim": 64,
18
+ "hidden_dim": 5120,
19
+ "n_heads": 20,
20
+ "vocab_size": 51866,
21
+ "max_source_positions": 1500,
22
+ "audio_encoding_args": {
23
+ "sampling_rate": 16000,
24
+ "num_mel_bins": 128,
25
+ "hop_length": 160,
26
+ "window_size": 400
27
+ }
28
+ },
29
+ "downsample_args": {
30
+ "downsample_factor": 4
31
+ }
32
+ }
33
+ }
34
+ }
preprocessor_config.json ADDED
@@ -0,0 +1,15 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "chunk_length": 30,
3
+ "dither": 0.0,
4
+ "feature_extractor_type": "WhisperFeatureExtractor",
5
+ "feature_size": 128,
6
+ "hop_length": 160,
7
+ "n_fft": 400,
8
+ "n_samples": 480000,
9
+ "nb_max_frames": 3000,
10
+ "padding_side": "right",
11
+ "padding_value": 0.0,
12
+ "processor_class": "VoxtralProcessor",
13
+ "return_attention_mask": false,
14
+ "sampling_rate": 16000
15
+ }
tekken.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4aaf3836c2a5332f029ce85a7a62255c966f47b6797ef81dedd0ade9c862e4a8
3
+ size 14894206