Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

1.4. Supported Models

Juno loads GGUF files with LLaMA-compatible architectures. Supported quantizations: F32, F16, BF16, Q8_0, Q4_0, Q2_K, Q3_K, Q4_K, Q5_K, Q6_K.

Architecture support matrix

Model familyChat template keyHandlerStatus
LLaMA 3llama3LlamaTransformerHandlerSupported
MistralmistralLlamaTransformerHandlerSupported
TinyLlama / ZephyrtinyllamaLlamaTransformerHandlerSupported
Phi-3 / Phi-3.5phi3Phi3TransformerHandlerSupported
GemmagemmaLlamaTransformerHandlerUnder development
Qwen 2 / 2.5chatmlLlamaTransformerHandler (+ QKV bias)Under development
Qwen3 (dense)chatmlQwen3TransformerHandlerUnder development
Qwen3-MoEchatmlQwen3MoeTransformerHandlerUnder development
Qwen3.5chatml (partial)Not yet implemented (hybrid DeltaNet architecture)Under development

“Under development” means template and handler groundwork exists for some paths, but end-to-end validation is still in progress. LoRA training and --lora-play inference are not available for architectures marked under development. See Handler routing for how dispatch works internally.

Example heap sizing

ModelApproximate sizeSuggested --heap
TinyLlama Q4_K_M~637 MB2g
Phi-3.5-mini Q4_K_M~2.2 GB4g
Mistral-7B Q4_K_M~4.1 GB8g
Llama-3.1-70B Q4_K_Mdistributed across nodessee Distributed inference

See also


<- 1.3 Quickstart: JVM Embedding  |  Table of Contents  |  2.1 Overview ->