DigitalBase Docs

モデル管理

LLM サーバ・モデル・GPU を管理画面から一元管理します。

対象:管理者必要権限:管理者ロールエディション:vLLM 版 / Ollama 版

できること

  • LLM サーバ(vLLM / Ollama)の登録・状態確認
  • 利用可能モデルの管理
  • 複数の推論サーバーを束ねて負荷分散(エンドポイントプール)
  • GPU リソースの確認
  • 利用状況・統計の確認
  • 推論性能のベンチマーク(vLLM)

バックエンド別の運用

区分モデルの供給
vLLM 版GPU サーバで提供するモデル(既定: チャット Qwen/Qwen3-4B、埋め込み Qwen/Qwen3-Embedding-0.6B。初回起動時に自動ダウンロード)
Ollama 版ローカルにダウンロードしたモデル
OpenAI 互換サーバー既存の GPU サーバーや他の推論基盤(LM Studio / Foundry Local 等)に接続。高度な設定 › OpenAI 互換の推論サーバー を参照
クラウド LLM 併用OpenAI / Anthropic / Gemini / xAI Grok(API キー)

推論サーバー(vLLM)の運用

vLLM 版では、用途別に 3 つの推論サーバー を個別に管理できます。

サーバー役割
chatチャット・生成・ツール呼び出し
embedRAG 用の埋め込み
vision画像・図面・帳票の読み取り(VLM)

管理画面から、サーバーごとに次の操作を行えます。

  • 起動 / 停止 / 再起動 — サーバー単位で個別に制御します。
  • 状態・ログの確認 — 稼働状態と起動ログを画面で確認します。
  • GPU・稼働監視 — GPU 使用率やスループットをメトリクスで確認します。
  • モデルの導入・切替 — Qwen・NVIDIA Nemotron 等を HuggingFace のモデル ID で導入します。

自動再起動と状態表示

本機で起動した推論サーバーは、本体が 30 秒ごとに死活を確認します(ENGINE_WATCHDOG_INTERVAL_SEC)。プロセスが落ちた場合や、ヘルスチェックに 3 回連続で失敗した場合(ENGINE_HEALTH_FAIL_THRESHOLD)は自動で再起動します。再起動の間隔は失敗のたびに 2 倍に伸び、最大 10 分です(ENGINE_RESTART_BACKOFF_MAX_SEC)。管理画面から「停止」したサーバーは再起動の対象外です。

モデル管理の各サーバー行には、起動ログから推定した段階(phase)と、失敗した場合の理由(reason)が表示されます。

表示意味
downloading (x%) / loading weights / compiling / readyモデルの取得 → 重みの読込 → コンパイル → 応答可能。大型モデルは ready まで数分〜数十分かかります
backoff失敗後の再起動待ち。次回の再試行時刻と自動再起動の回数を併記します
failed再起動しても起動できない状態。理由を確認してください
reason の例port <番号> in use(ポート競合)/ GPU not detected / GPU out of memory / model not found in cache(閉域でモデル未配置)/ engine package not installed / process killed

起動前の警告(warnings)も同じ場所に出ます。モデルキャッシュのディスク空き容量が 20 GB を下回ると「low disk space」(ENGINE_MIN_FREE_GB)、モデルの重みが GPU の空きメモリを超えそうなときは「model weights exceed free VRAM」と表示されます。

  • 複数 GPUVLLM_TENSOR_PARALLEL0(既定)のときは GPU 枚数から tensor parallel 数を自動で決めます(GPU 枚数以下の最大の 2 の冪、上限 ENGINE_TENSOR_PARALLEL_MAX)。明示した値が優先されます(高度な設定)。
  • ログ — 推論サーバーの起動ログはインストール先の logs/(例 ~/.local/db/logs/ENGINE_LOG_DIR)に保存され、50 MB ごとに 3 世代までローテーションします。画面の「ログ」から末尾を確認できます。
  • 死活監視 — 監視ツールからは GET /api/ready(DB・migration・推論サーバーがすべて揃ったときだけ 200)を使います(監視と利用計測)。

閉域環境へのモデル持ち込み

インターネットに出られない環境では、別の PC で取得したモデルを管理画面の 「モデルを取り込む (閉域)」 から取り込みます。サーバー上のパス(USB メモリ等)を指定すると、HuggingFace のキャッシュ(HF_HOME)に配置され、以後はオフラインで起動できます。

受け付ける形式は次の 2 つです(ディレクトリでも tar でも可)。

# 1. モデルのファイル一式(repo_id の指定が必要。例: Qwen/Qwen3-8B)
Qwen3-8B/
├── config.json
├── model-00001-of-00004.safetensors ... model.safetensors.index.json
├── tokenizer.json / tokenizer_config.json
└── generation_config.json

# 2. HuggingFace キャッシュと同じ配置(repo_id / revision は配置から自動判定、複数モデル可)
models--Qwen--Qwen3-8B/snapshots/<rev>/{config.json, *.safetensors, tokenizer*}

取り込み時に config.json が読めること・重みファイルがあること・model.safetensors.index.json に列挙された分割ファイルがすべて揃っていることを検査し、不足があれば取り込みません。同じ版が既にある場合は上書きを選ばない限り取り込みません。取り込み後、.envVLLM_CHAT_MODEL 等にモデル ID を設定して起動します。オフライン運用では HF_HUB_OFFLINE=1 も設定してください(インストール › オフラインでのインストール)。

複数の推論サーバーをまとめて使う(エンドポイントプール)

GPU ごと、あるいは別マシンに立てた複数の vLLM サーバーを 1 つのプールとして束ね、負荷分散できます。設定方法と管理画面での見え方は 高度な設定 › エンドポイントプール を参照してください。

GPU 監視(DCGM)

モデル管理画面では、各 vLLM 接続先の GPU 使用率・温度・電力・VRAM を確認できます。接続先ホストで動作する DCGM exporter(既定ポート 9400.envDCGM_PORT で変更可)から自動取得され、exporter が無い接続先は「—」と表示されます。

exporter の導入手順

前提として、接続先の GPU ホストに NVIDIA DCGM 本体(dcgmi コマンド)が必要です。未導入の場合は NVIDIA CUDA リポジトリから バージョン 4 系 を導入します(Ubuntu 標準 apt の datacenter-gpu-manager は 3 系のため不可)。

# CUDA リポジトリ未登録の場合は先に cuda-keyring を導入(NVIDIA ドライバ導入済みなら登録済みのことが多い)
sudo apt-get install -y datacenter-gpu-manager-4-core datacenter-gpu-manager-4-cuda13   # CUDA 12 環境は -4-cuda12

続いて、GPU ホストで次を実行します。

curl -fsSL https://pub-a2cab4360f1748cab5ae1c0f12cddc0a.r2.dev/vite-scripts/install-dcgm-exporter.sh | bash

DCGM サービスの有効化、exporter の配置(:9400)、systemd への常駐登録、動作確認までを一括で行います。導入後、モデル管理画面の [更新] で温度・電力が表示されます。

補足

arm64 機(GB10 / DGX 系)では本家 dcgm-exporter の apt / バイナリ配布が無いため、このスクリプトは依存の無い最小 exporter を配置します。x86_64 で本家 dcgm-exporter(コンテナ運用)を既にお使いの場合はそのままで動作します。ユニファイドメモリ機では VRAM(FB 系)は取得できず「—」表示になります。

ベンチマーク(性能計測)

vLLM サーバーに対して、スループット・レイテンシなどの推論性能を計測できます。GPU 構成やモデル選定の判断に使います。

モデルの追加(Ollama)

サーバ側でモデルを取得すると、チャットの一覧に表示されます。

ollama pull gemma3:4b
ollama pull nomic-embed-text   # RAG 用 埋め込み
補足

チャットに表示されるモデル一覧は、サーバ側の対応に従います。ツール呼び出しの可否もサーバ側の対応次第です。vLLM 版では .envVLLM_TOOL_CALL_PARSER / VLLM_REASONING_PARSER で指定します(既定値は同梱の Qwen3 モデル用なので、モデルを変えたら合わせて変更してください)。Hugging Face モデルカードの vllm serve コマンドを貼り付けて .env 設定に変換する「vLLM設定」ボタンも利用できます。環境変数による自動起動と、管理画面からの管理を併用できます。

関連