{ "architectures": [ "LlamaForCausalLM" ], "attention_bias": false, "attention_dropout": 0.0, "auto_map": { "AutoModelForCausalLM": "modeling_lean_llama.LeanLlamaForCausalLM" }, "bos_token_id": 128000, "dtype": "float16", "eos_token_id": [ 128001, 128008, 128009 ], "head_dim": 128, "hidden_act": "silu", "hidden_size": 4096, "initializer_range": 0.02, "intermediate_size": 14336, "leanllm_compressed_kv_layers": [ 18, 20, 24, 26, 28, 30 ], "leanllm_kv_decoder_depth": { "18": 2, "20": 2, "24": 2, "26": 2, "28": 2, "30": 2 }, "leanllm_kv_decoder_hidden_dim": { "18": 256, "20": 256, "24": 256, "26": 256, "28": 256, "30": 256 }, "leanllm_kv_fixed_alpha": { "18": 1.0, "20": 1.0, "24": 1.0, "26": 1.0, "28": 1.0, "30": 1.0 }, "leanllm_kv_granularity": { "18": "per_token", "20": "per_token", "24": "per_token", "26": "per_token", "28": "per_token", "30": "per_token" }, "leanllm_kv_input_dims": { "18": 1024, "20": 1024, "24": 1024, "26": 1024, "28": 1024, "30": 1024 }, "leanllm_kv_key_dims": { "18": 0, "20": 0, "24": 0, "26": 0, "28": 0, "30": 0 }, "leanllm_kv_residual_decoder": { "18": false, "20": false, "24": false, "26": false, "28": false, "30": false }, "leanllm_kv_value_dims": { "18": 4, "20": 4, "24": 4, "26": 4, "28": 4, "30": 4 }, "leanllm_values_only": true, "max_position_embeddings": 131072, "mlp_bias": false, "model_type": "llama", "num_attention_heads": 32, "num_hidden_layers": 32, "num_key_value_heads": 8, "pad_token_id": null, "pretraining_tp": 1, "rms_norm_eps": 1e-05, "rope_parameters": { "factor": 8.0, "high_freq_factor": 4.0, "low_freq_factor": 1.0, "original_max_position_embeddings": 8192, "rope_theta": 500000.0, "rope_type": "llama3" }, "tie_word_embeddings": false, "transformers_version": "5.1.0", "use_cache": true, "vocab_size": 128256 }