ローカルLLMでコーディングする方法!おすすめモデルと設定・注意点を解説

会社のコードを外部のAIに送れず、AIを使ったコーディングをあきらめている方も多いのではないでしょうか。ローカルLLMなら送らずに済むと聞いても、どのモデルを選び、何を設定すればよいのかが分からない場面もあるはずです。
この記事では、ローカルLLMでコーディングする方法・使えるモデル・始める手順・必要なPCのスペック・注意点を、Ollamaと各モデルの公式情報に沿って解説します(2026年10月5日時点)。
記事を読めば、自分のPCでローカルLLMのコーディングを試す手順が分かる状態です。結論は、ローカルLLMのコーディングはコードを外部に送らずに使える反面、性能と速度はクラウドのAIに及びません。機密のコードを扱う作業に絞って、小さな作業から試しましょう。
ローカルLLMでコーディングする方法とは
ローカルLLMでのコーディングは、以下の3つで押さえます。
- コードを外部に送らずにAIにコーディングを頼める
- コーディングの道具とローカルのモデルをつないで使う
- 性能と速度はクラウドのAIに及ばない
コードを外部に送らずにAIにコーディングを頼める
ローカルLLMは、自分のPCや社内のサーバーの中で動かすAIです。コードと指示の内容が外部に送られないため、社外に出せないコードでもAIに扱わせられます。
ローカルLLMとは?クラウドAIとの違いやメリット・できることを解説
コーディングの道具とローカルのモデルをつないで使う
ローカルLLMのコーディングでは、コーディングの道具と、手元で動かすモデルをつなぎます。モデルを動かすソフトのOllamaは、Claude CodeやCodex CLIとの連携に対応しています。
Claude Codeは、コードを読んでファイルを編集し、コマンドも実行する道具です。Ollamaとつなぐと、AIの部分だけをローカルのモデルに置き換えて使えます。
性能と速度はクラウドのAIに及ばない
PCで動かせるモデルは、クラウドで提供される最新のモデルより小さく作られています。複雑な作業や、多くのファイルにまたがる作業では、結果に差が出る場合があります。
回答の速度を左右するのは、PCの性能です。すべての作業をローカルに置き換えるのではなく、機密のコードを扱う作業に使う位置づけが現実的です。
コーディングに使えるローカルLLMのモデル
コーディングに使える主なモデルは、以下の表のとおりです。容量は、Ollamaの公式ライブラリの表示にもとづきます。
| モデル | 容量 | 特徴 |
|---|---|---|
| Qwen3.6 | 27bは18GBから・35bは23GBから | エージェント型のコーディングを強化 |
| Qwen3-Coder | 30bは19GB | エージェントとコーディング向けで長い文章を扱える |
| Devstral Small 2 | 15GB | ソフトウェア開発の作業向け |
| gpt-oss | 20bは14GB | 16GBのメモリが目安 |
各モデルの特徴は、以下の4つです。
- Qwen3.6はエージェント型のコーディングを強化している
- Qwen3-Coderはコーディング向けに作られている
- Devstral Small 2は複数のファイルの編集を得意とする
- gpt-ossは少ないメモリで動かせる
Qwen3.6はエージェント型のコーディングを強化している
Qwen3.6は、Alibabaが公開しているモデルです。AIが自律的にプログラムを書く作業の性能を、前の世代から大きく高めたと説明されています。
画面の実装や、複数のファイルにまたがる推論の精度が上がったとの説明です。ライセンスはApache 2.0です。
Qwen3-Coderはコーディング向けに作られている
Qwen3-Coderは、Alibabaが公開しているコーディング向けのモデルです。30bのサイズは、容量が19GBです。
長い文章を一度に扱える点が特徴で、多くのファイルを読ませる作業に向いています。最も大きいサイズは容量が290GBあり、一般のPCでは動かせません。
Devstral Small 2は複数のファイルの編集を得意とする
Devstral Small 2は、ソフトウェア開発の作業向けに作られたモデルです。道具を使ってコードを調べ、複数のファイルを編集する作業を得意とすると説明されています。
容量は15GBで、文章に加えて画像の入力にも対応しています。
gpt-ossは少ないメモリで動かせる
gpt-ossは、OpenAIが公開しているモデルです。20bのサイズは容量が14GBで、16GBのメモリが目安とされています。
Ollamaの公式ドキュメントは、Codex CLIとつなぐ例にgpt-ossを使っています。
ローカルLLMのおすすめモデル!PCの性能と用途別の選び方を解説
ローカルLLMでコーディングを始める手順
始める手順は、以下の4つです。
- Ollamaをインストールしてモデルを入れる
- 扱える文章の量を6万4,000トークン以上に設定する
- OllamaからClaude CodeかCodexを起動する
- 小さな作業で動作を確かめる
Ollamaをインストールしてモデルを入れる
最初に、Ollamaを公式サイトからインストールします。続けて、使いたいモデルをダウンロードします。
モデルの容量が、PCのメモリに収まるかを先に確かめてください。
ローカルLLMの作り方!必要なPCと無料の構築手順・注意点を解説
扱える文章の量を6万4,000トークン以上に設定する
コンテキストの長さは、モデルが一度に扱える文章の量を指す言葉です。Ollamaの公式ドキュメントは、コーディングの道具を使う場合、6万4,000トークン以上に設定するよう案内しています。
初期の設定は、GPUのメモリの容量で変わります。24GB未満では、4,000トークンです。設定は、Ollamaのアプリの設定の画面で変えられます。
OllamaからClaude CodeかCodexを起動する
Ollamaには、コーディングの道具を起動するコマンドがあります。Claude Codeは ollama launch claude で、Codex CLIは ollama launch codex で起動する形です。
起動のときに、使うモデルを選びます。道具とモデルをつなぐ設定は、Ollamaが行う仕組みです。
Claude CodeでローカルLLMを使う方法|Ollama連携の手順と注意点
小さな作業で動作を確かめる
最初は、練習用のフォルダで小さな作業を頼みます。コードの説明や、1つの関数の修正など、結果を確かめやすい作業から試してください。
回答の質と速度が、用途に足りるかを確かめます。
ローカルLLMのコーディングに必要なスペック
必要なスペックは、以下の3つで押さえます。
- モデルの容量に加えて文章を扱う分のメモリが要る
- コーディング向けのモデルは24GB以上のメモリが目安になる
- 16GBのPCは短いコードの生成にとどめる
モデルの容量に加えて文章を扱う分のメモリが要る
コンテキストの長さを大きくすると、必要なメモリが増えます。Ollamaの公式ドキュメントも、設定を大きくする前に、GPUのメモリが足りるかを確かめるよう注意しています。
コーディングでは、モデルの容量ちょうどのメモリでは足りません。
コーディング向けのモデルは24GB以上のメモリが目安になる
表のモデルの容量は、14GBから23GBです。文章を扱う分を加えると、24GB以上のメモリか、同じ程度のGPUのメモリが目安になります。
Qwen3.6の35bなど、容量が20GBを超えるモデルは、さらに余裕のある機器が必要です。
ローカルLLMに必要なスペック!メモリとGPUの目安・PCの選び方を解説
16GBのPCは短いコードの生成にとどめる
メモリが16GBのPCでは、コーディングの道具とつないだ使い方は厳しくなります。小さなモデルで、短いコードの生成や説明を頼む使い方にとどめてください。
ローカルLLMでコーディングするときの注意点
注意点は、以下の4つです。
- 複雑な作業はクラウドのAIに及ばない
- 道具の呼び出しに対応したモデルを選ぶ
- 回答が遅いと作業が進まない
- 生成されたコードは必ず確かめる
複雑な作業はクラウドのAIに及ばない
多くのファイルにまたがる変更や、設計の判断が要る作業は、ローカルのモデルでは結果が安定しない場合があります。うまくいかない作業は、扱える範囲でクラウドのAIに切り替えてください。
道具の呼び出しに対応したモデルを選ぶ
コーディングの道具は、ファイルの読み書きやコマンドの実行を、モデルからの呼び出しで行います。Ollamaの公式ドキュメントは、対応したモデルで道具を使えると説明しています。
対応していないモデルでは、ファイルの編集などが動きません。
回答が遅いと作業が進まない
コーディングでは、AIがファイルの読み取りと書き換えを何度も繰り返します。1回の回答が遅いと、全体の作業に長い時間がかかります。
試した結果が遅すぎる場合は、1つ小さなモデルに替えるか、PCの構成を見直してください。
生成されたコードは必ず確かめる
ローカルのモデルが書いたコードにも、誤りが含まれます。動かして確かめ、業務で使うコードは、内容を判断できる人が確かめてください。
AIコードレビューとは?できることと主なツール・導入の進め方を解説
ローカルLLMのコーディングのよくある質問
よく出る疑問は、以下の4つです。
- 無料で使えますか?
- Claude Codeで使えますか?
- どのモデルがおすすめですか?
- クラウドのAIとどう使い分ければよいですか?
無料で使えますか?
モデルとOllamaは、無料で使えます。かかる費用は、PCの購入費と電気代です。
Claude Codeで使えますか?
使えます。Ollamaには、Claude Codeをローカルのモデルとつないで起動するコマンドがあります。
コンテキストの長さを、6万4,000トークン以上に設定してから使ってください。
どのモデルがおすすめですか?
メモリに余裕がある場合は、Qwen3.6かQwen3-Coderが候補です。メモリが少ない場合は、gpt-ossの20bから試してください。
クラウドのAIとどう使い分ければよいですか?
社外に出せないコードを扱う作業をローカルLLMに任せ、ほかの作業はクラウドのAIに任せる分け方が現実的です。会社のルールで、どのコードをどちらで扱うかを決めておきましょう。
ローカルLLMのコーディングは小さな作業から試しましょう
ローカルLLMのコーディングは、コードを外部に送らずにAIを使える方法です。Ollamaで、Claude CodeやCodexをローカルのモデルとつないで使えます。
まずは、PCのメモリに収まるモデルを入れてコンテキストの長さを設定し、小さな作業から試しましょう。性能と速度が足りない作業は、クラウドのAIと使い分けてください。



