跳至主要内容

GenAI搭配LLiMa

LLiMa 是 GenAI 工具組,用於在 Model Compiler 中編譯、測試、進行基準測試、部署和執行 LLM、VLM 和 ASR 模型,並在 Modalix 上運行。

LLiMa 支援三種輸入格式:

  • Hugging Face safetensors — 標準的 LLM 和 VLM 模型目錄
  • GGUF 檔案 — 以 GGUF 格式封裝的 LLM 模型。
  • 壓縮張量模型——預先量化過的 GPTQ/AWQ 樣式的 safetensor 模型。

SiMa.ai 同時也會發布預先編譯的 GenAI 模型位於 Hugging Face。當已存在合適的模型時,從這裡開始。

對於具體情況 GenAI 範例,請參閱 範例.

LLiMa 可用性​

LLiMa 編譯工具預設會安裝在 Model Compiler 中。 LLiMa 執行階段會原生安裝在 Modalix 上,作為 Neat 執行階段的一部分。 請參閱 Neat Framework 安裝,以了解執行階段的安裝流程。

貢獻​

修改 LLiMa 本身的貢獻者應遵循 《LLiMa 貢獻者指南》,其中涵蓋了程式碼庫結構、開發環境、測試層級、模型輸入政策以及提交請求的要求。

支援的模型​

下表顯示支援的模型架構及其功能:

模型架構類型支援的尺寸
Llama 2LLM7b
Llama 3.1LLM8b
Llama 3.2LLM1b, 3b
Gemma 1LLM2b、7b
Gemma 2LLM2b、9b
Gemma 3LLM1b, 4b
Phi 3.5 mini LLM3.8b
Phi 4 mini LLM3.8b
Qwen 2.5LLM0.5b、1.5b、3b、7b
Qwen 3LLM0.6b、1.7b、4b、8b
Mistral 1LLM7b
LFM 2LLM350m、1.2b、2.6b。
Llava 1.5VLM7b
PaliGemmaVLM3b
Gemma 3VLM4b
Gemma 4VLME2B, E4B
Qwen 2.5 VL VLM3b, 7b
Qwen 3 VL VLM2b, 4b, 8b
LFM 2VLM450m,1.6b,3b。
WhisperASRsmall

限制事項​

限制類型描述
模型架構僅支援基於上述架構的模型。
模型參數僅支援參數數量少於 100 億的模型。
HF 模型模型必須以本機 Hugging Face 目錄的形式提供,該目錄應包含 config.json、safetensor 權重,以及架構所需的權杖化器和處理器檔案。generation_config.json 則是可選的。
GGUF 模型GGUF 格式僅適用於 LLM。VLM 必須從 Hugging Face 的 safetensors 格式進行編譯。請注意,與 Hugging Face safetensor 編譯相比,效能可能會降低。
壓縮張量模型支援的 LLM 和 VLM 可以使用預先量化的 safetensor 模型(GPTQ/AWQ),這些模型是使用 llm-compressor 建立的。模型必須使用對稱量化,並且使用支援的 compressed-tensors 佈局。這些模型可以在維持高效能的同時,達到比標準 INT4 量化更好的準確度。
Gemma3 VLM支援經過修改的 SigLip 448 視覺編碼器。
LLAMA 3.2 視覺模型視覺模型目前不支援。