ChatGPTなどのクラウドAIは便利ですが、「社内の資料を外に送りたくない」「API料金を気にせず試したい」と感じる場面もあります。そんなときの選択肢が、手元のPCでAIを動かすローカルAIです。
Lemonade Serverって、AMDのNPUがないと使えないんですか?画像生成もできると聞いたんですが…。
この記事の結論
Lemonade Serverは、チャット・文字起こし・音声合成・画像生成を自分のPCで無料で動かせるローカルAIサーバーです。Windowsなら lemonade.msi を入れて、lemonade run モデル名 で動かせます。AMDのNPU(XDNA2世代)はチャットと文字起こしに使われ、画像生成はGPU(Vulkan)かCPUで動きます(2026年10月時点・v2026.40.0)。
この記事で分かること
- Lemonade Serverでできることと、対応しているPC
- Windowsでのインストールから最初のチャットまで
- 画像生成・文字起こし・音声合成の動かし方
- ほかのアプリやプログラムから使う方法
Lemonade Serverとは
Lemonade Serverは、AMDのエンジニアが最適化に関わっているオープンソースのローカルAIサーバーです。公式のGitHubでは「クラウドのAPIと同じことが、無料かつプライベートにできる」と紹介されています。
主な特徴は次のとおりです。
- いろいろなAIを1つで動かせる:チャット(LLM)、文字起こし(Whisper)、音声合成、画像生成(Stable Diffusion)などに対応
- ほかのアプリとつなげやすい:OpenAI・Anthropic・Ollamaと同じ形式のAPIで使える
- 対応するPCが広い:Windows 11、Linux、macOS、Dockerで動き、AMDのNPU・GPU、NVIDIAのGPU、Apple Silicon、普通のCPUに対応

何をどこで動かすか:NPU・GPU・CPUの対応表
「NPUで全部動く」と思われがちですが、実際は機能ごとに使う部品が違います。公式の対応表(Windowsの場合)を整理すると、次のようになります。
| 機能 | AMDのNPU | GPU | CPU |
|---|---|---|---|
| チャット(LLM) | 使える(XDNA2) | 使える(Vulkan・ROCm・CUDA) | 使える |
| 文字起こし(Whisper) | 使える(XDNA2) | 使える(Vulkan・ROCm) | 使える |
| 音声合成(kokoro) | ― | ― | 使える |
| 画像生成(Stable Diffusion) | ― | 使える(Vulkan・CUDA) | 使える |
自分のPCでどれが使えるかは、インストール後に次のコマンドで確認できます。
lemonade backends
NPUを使えるのはXDNA2世代のNPUを積んだAMDのPCです。NPUがないPCでも、GPUやCPUで同じ機能を使えます。NPUの利点は、GPUやCPUの負担を減らしながら動かせることです。
Windowsでインストールして、最初のチャットをする
- GitHubのリリースページから、Windows用の
lemonade.msiをダウンロードする - ダウンロードしたファイルを開いて、インストールする
- ターミナル(PowerShellなど)を開き、次のコマンドでモデルをダウンロードして会話を始める
lemonade run Gemma-4-E2B-it-GGUF
使えるモデルの一覧と、ダウンロードだけしたいときは次のコマンドです。
lemonade list
lemonade pull Gemma-4-E2B-it-GGUF
コマンドが苦手な人は、アプリに入っているModel Manager(モデルの管理画面)から探してダウンロードすることもできます。チャットや画像生成を試せる画面も最初から入っています。
画像生成を試す
画像生成は、Stable DiffusionのSDXL-Turboで試せます。
lemonade run SDXL-Turbo
Windowsでは、画像生成はGPU(Vulkan対応)かCPUで動きます。AMDのRyzen AI搭載PCなら、内蔵GPU(iGPU)をVulkanで使う形になります。NPUは画像生成には使われないので、「NPUがあるのに速くならない」と感じたら、GPUで動いているかを lemonade backends で確かめてみてください。
v2026.40.0では、不具合の修正のため、画像生成のROCm(AMD GPU向け)の動かし方が一時的に外されています。AMDのGPUで画像生成をするなら、Vulkanで動かしましょう。
文字起こし・音声合成を試す
音声ファイルの文字起こしは、Whisperのモデルで試せます。WindowsでXDNA2世代のNPUがあれば、NPUで動かせます。
lemonade run Whisper-Large-v3-Turbo
文章を読み上げる音声合成は、kokoroのモデルで試せます。
lemonade run kokoro-v1
ほかのアプリやプログラムから使う
Lemonade ServerはOpenAIと同じ形式のAPIで使えるので、OpenAIに対応したアプリやライブラリの接続先を変えるだけでローカルAIに切り替えられます。公式のPythonの例は次のとおりです。
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:13305/api/v1",
api_key="lemonade" # 入力は必要だが、使われない
)
completion = client.chat.completions.create(
model="Gemma-4-E2B-it-GGUF",
messages=[{"role": "user", "content": "日本の首都はどこ?"}]
)
print(completion.choices[0].message.content)
コーディングに使いたい場合は、lemonade launch claude のように、対応しているコーディング用のツールをLemonadeのモデルで起動する機能もあります。
自宅のLemonade Serverに外出先からつなぎたい場合は、Cloudflare Accessで自宅のローカルAIに安全に外部からアクセスする設定手順も参考にしてください。

つまずきやすいポイント
| 症状 | まず確認すること |
|---|---|
| NPUが使われない | lemonade backends でNPUの項目が出ているか。NPUのドライバが最新か |
| 動作がとても遅い | モデルが大きすぎないか。まずは小さいモデルで試す |
| アプリからつながらない | 接続先のURL(ポート13305)と、ほかのアプリとポートがぶつかっていないか |
| 画像生成が遅い | CPUで動いていないか。Vulkan対応のGPUで動かせるか |
よくある質問
Lemonade Serverは無料ですか?
無料のオープンソースソフトです。モデルのダウンロード時にHugging Faceなどにつながる以外は、利用者が求めない限り外部に情報を送らないと、公式のプライバシーポリシーに書かれています。
AMD以外のPCでも使えますか?
使えます。NVIDIAのGPU、Apple Siliconのmac、普通のCPUでも動きます。AMDのPCでは、NPUや内蔵GPUを生かせるように最適化されています。
Ollamaとの違いは何ですか?
どちらもローカルでLLMを動かせますが、Lemonade ServerはAMDのNPUへの対応や、画像生成・音声合成まで1つで扱える点が特徴です。また、OllamaのAPI形式にも対応しているので、Ollama向けのアプリからも使えます。
どのくらい頻繁に更新されますか?
更新はとても活発で、2026年10月時点の最新版はv2026.40.0です。機能や対応する部品が変わることがあるので、更新したらリリースノートを確認しましょう。
まとめ
Lemonade Serverを使えば、チャット・文字起こし・音声合成・画像生成を、手元のPCで無料で動かせます。AMDのNPUはチャットと文字起こしに、画像生成はGPUかCPUに使われる、という役割分担を知っておくと迷いません。
まずは lemonade.msi を入れて、lemonade backends で自分のPCで使える動かし方を確かめるところから始めてみてください。
出典・参考
Lemonade(GitHub)、Lemonade Releases(v2026.40.0)(2026年10月時点)
会議の録音〜要約を1台で済ませるなら
録音・文字起こし・AI要約までワンタッチのAIボイスレコーダーもあります。ツール連携の手間をなくしたい方向けです。





コメント