在地的模型當然
要可以跑在地端

老鮑伯

Agenda

  • 地端推論運算架構解析
  • 地端設備運行 Twinkle AI 模型挑戰
    • 地端硬體規格
    • Ollama
    • LM Studio
    • Lemonade
    • vLLM
    • oBeaver
  • 結論

Slide URL

地端推論運算架構解析

地端主流以 OpenAI compatible RESTful API 做為與其他框架的整合方法。

GPU vs NPU

  • GPU (Graphics Processing Unit)
    • 高效能
    • 除了整合/UMA架構之外,其他為獨立高速高成本 VRAM
    • 大部分的 LLM 推論框架都支援 GPU
      (通常模型不需轉檔)
    • 算力強VRAM大的可以對模型做再次加工(如量化、蒸餾、LoRA)
  • NPU (Neural Processing Unit)
    • 省電(適合低功耗設備/長時間運行的場合)
    • 針對 AI 推論硬體加速
    • 記憶體與CPU共用/整合在 SoC 晶片內
    • 目前仍以 ONNX Runtime 為主流,對於 LLM 推論框架的支援度不如 GPU
      (需從原始 Safetensors 或 GGUF 格式模型轉檔)

NPU 各自的硬體設計架構

Intel

AMD

GGUF file format

目前LLM模型的主流格式為 GGUF (GGML Unified Format):

https://github.com/ggml-org/ggml/blob/master/docs/gguf.md

GGML 團隊所提出的統一格式,目的是為了讓不同的 LLM 推論框架可以共用同一個模型檔案。

llama.cpp 開源專案有提供轉換的 Python script,將原始 Hugging Face 的 Safetensors 模型轉換成 GGUF 格式。

GGUF 模型檔即時轉換

Intel 早期的 OpenVINO LLM 推論框架,對於 GGUF 模型檔的支援度不佳,必須先將 GGUF 模型檔轉換成 ONNX 格式才能使用。

今年開始的版本提供即時轉換功能,因此可以直接使用 GGUF 模型檔。

https://docs.openvino.ai/2026/openvino-workflow/model-preparation.html

後續的改良會使用 llama.cpp 開源專案的成果來做 GGUF 檔案轉換:https://github.com/openvinotoolkit/openvino/pull/36579

地端設備運行
Twinkle AI 模型
挑戰

目標模型

為了力求能以最經濟實惠&簡單的方式跑起來,使用 Twinkle AI T1 Series 模型,直接取用 GGUF 格式模型檔。

https://twinkleai.tw/models

https://huggingface.co/twinkle-ai/gemma-3-4B-T1-it-GGUF

使用的地端算力設備

目前對於軟體支援度/VRAM大小比較起來
c/p值還行的 AMD Radeon RX 9060 XT(16GB VRAM) 顯示卡

https://www.techpowerup.com/gpu-specs/radeon-rx-9060-xt-16-gb.c4293

地端AI推論工具/框架&是否work

工具/框架 是否work 備註
Ollama 開箱即用
LM Studio 要手動裝 ROCm provider
Lemonade 要手動裝 ROCm provider
vLLM ⁉️ Windows WSL2 跑目標模型crash
oBeaver 需要手動模型轉檔
(底層使用 MS Foundry Local 實現模型運算)


目前僅使用Windows 11筆電可跑的框架

Ollama

  • 直接使用 Hugging Face 提供的指令跑就會自動下載/執行模型

Ollama run log

  • 使用的VRAM最少

LM Studio

基本上跟 Ollama 一樣,使用 Hugging Face 網頁上的連結點選後,會自動導引至LM Studio 進行下載/執行模型

但目前這張 Radeon RX 9060 XT 顯示卡 在 LM Studio 使用 ROCm provider 有一個配合其他AMD GPU 同時運行的bug,已經拖半年沒有解決😏

Lemonade

手動安裝 ROCm provider 和 Hugging Face downlaoder 之後,就可以搜尋之後下載 Twinkle AI T1 Series 模型,並且執行模型。

Lemonade 使用 AMD Ryzen AI Server NPU 的 LLM 推論框架(也是要轉模型),目前在 gpt-oss-20b 有奇怪的問題:

但另一個開源的 NPU LLM 推論框架 FastFlowLM 內建在 Lemonade 正常的😅

vLLM

目前 Twinkle AI T1 Series 模型在 vLLM 上跑會 crash,原因是 base model 使用的 Gemma 3 base model 需要 v4.50.x 舊版 Transformer python PIP 套件,但目前最新 nightly build 版本的 vLLM 已經使用 v5.1.x 。

oBeaver

oBeaver 是 Microsoft Foundry Local 的前端 GUI,底層使用 Foundry Local 做模型運算。

目前需要手動執行轉換工具轉換 GGUF 模型檔成 Foundry Local 可使用的格式,才能在 oBeaver 上執行。 https://www.khawarhabib.com/blogs/the-ultimate-guide-to-compiling-hugging-face-models-for-foundry-local

(所以我們就先不管它 再看看 😅)

結論

其他參考資料

GGUF file format

Books

Video

Papers/Web articles