AIツール活用

ローカルLLMでコーディングする方法!おすすめモデルと設定・注意点を解説

中島大介(なかじ)読了時間 約11分
ローカルLLMでのコーディングのアイキャッチ

会社のコードを外部のAIに送れず、AIを使ったコーディングをあきらめている方も多いのではないでしょうか。ローカルLLMなら送らずに済むと聞いても、どのモデルを選び、何を設定すればよいのかが分からない場面もあるはずです。

この記事では、ローカルLLMでコーディングする方法・使えるモデル・始める手順・必要なPCのスペック・注意点を、Ollamaと各モデルの公式情報に沿って解説します(2026年10月5日時点)。

記事を読めば、自分のPCでローカルLLMのコーディングを試す手順が分かる状態です。結論は、ローカルLLMのコーディングはコードを外部に送らずに使える反面、性能と速度はクラウドのAIに及びません。機密のコードを扱う作業に絞って、小さな作業から試しましょう。

ローカルLLMでコーディングする方法とは

ローカルLLMでのコーディングは、以下の3つで押さえます。

  • コードを外部に送らずにAIにコーディングを頼める
  • コーディングの道具とローカルのモデルをつないで使う
  • 性能と速度はクラウドのAIに及ばない

コードを外部に送らずにAIにコーディングを頼める

ローカルLLMは、自分のPCや社内のサーバーの中で動かすAIです。コードと指示の内容が外部に送られないため、社外に出せないコードでもAIに扱わせられます。

ローカルLLMとは?クラウドAIとの違いやメリット・できることを解説

コーディングの道具とローカルのモデルをつないで使う

ローカルLLMのコーディングでは、コーディングの道具と、手元で動かすモデルをつなぎます。モデルを動かすソフトのOllamaは、Claude CodeやCodex CLIとの連携に対応しています。

Claude Codeは、コードを読んでファイルを編集し、コマンドも実行する道具です。Ollamaとつなぐと、AIの部分だけをローカルのモデルに置き換えて使えます。

性能と速度はクラウドのAIに及ばない

PCで動かせるモデルは、クラウドで提供される最新のモデルより小さく作られています。複雑な作業や、多くのファイルにまたがる作業では、結果に差が出る場合があります。

回答の速度を左右するのは、PCの性能です。すべての作業をローカルに置き換えるのではなく、機密のコードを扱う作業に使う位置づけが現実的です。

コーディングに使えるローカルLLMのモデル

コーディングに使える主なモデルは、以下の表のとおりです。容量は、Ollamaの公式ライブラリの表示にもとづきます。

モデル容量特徴
Qwen3.627bは18GBから・35bは23GBからエージェント型のコーディングを強化
Qwen3-Coder30bは19GBエージェントとコーディング向けで長い文章を扱える
Devstral Small 215GBソフトウェア開発の作業向け
gpt-oss20bは14GB16GBのメモリが目安

各モデルの特徴は、以下の4つです。

  • Qwen3.6はエージェント型のコーディングを強化している
  • Qwen3-Coderはコーディング向けに作られている
  • Devstral Small 2は複数のファイルの編集を得意とする
  • gpt-ossは少ないメモリで動かせる

Qwen3.6はエージェント型のコーディングを強化している

Qwen3.6は、Alibabaが公開しているモデルです。AIが自律的にプログラムを書く作業の性能を、前の世代から大きく高めたと説明されています。

画面の実装や、複数のファイルにまたがる推論の精度が上がったとの説明です。ライセンスはApache 2.0です。

Qwen3-Coderはコーディング向けに作られている

Qwen3-Coderは、Alibabaが公開しているコーディング向けのモデルです。30bのサイズは、容量が19GBです。

長い文章を一度に扱える点が特徴で、多くのファイルを読ませる作業に向いています。最も大きいサイズは容量が290GBあり、一般のPCでは動かせません。

Devstral Small 2は複数のファイルの編集を得意とする

Devstral Small 2は、ソフトウェア開発の作業向けに作られたモデルです。道具を使ってコードを調べ、複数のファイルを編集する作業を得意とすると説明されています。

容量は15GBで、文章に加えて画像の入力にも対応しています。

gpt-ossは少ないメモリで動かせる

gpt-ossは、OpenAIが公開しているモデルです。20bのサイズは容量が14GBで、16GBのメモリが目安とされています。

Ollamaの公式ドキュメントは、Codex CLIとつなぐ例にgpt-ossを使っています。

ローカルLLMのおすすめモデル!PCの性能と用途別の選び方を解説

ローカルLLMでコーディングを始める手順

始める手順は、以下の4つです。

  • Ollamaをインストールしてモデルを入れる
  • 扱える文章の量を6万4,000トークン以上に設定する
  • OllamaからClaude CodeかCodexを起動する
  • 小さな作業で動作を確かめる

Ollamaをインストールしてモデルを入れる

最初に、Ollamaを公式サイトからインストールします。続けて、使いたいモデルをダウンロードします。

モデルの容量が、PCのメモリに収まるかを先に確かめてください。

ローカルLLMの作り方!必要なPCと無料の構築手順・注意点を解説

扱える文章の量を6万4,000トークン以上に設定する

コンテキストの長さは、モデルが一度に扱える文章の量を指す言葉です。Ollamaの公式ドキュメントは、コーディングの道具を使う場合、6万4,000トークン以上に設定するよう案内しています。

初期の設定は、GPUのメモリの容量で変わります。24GB未満では、4,000トークンです。設定は、Ollamaのアプリの設定の画面で変えられます。

OllamaからClaude CodeかCodexを起動する

Ollamaには、コーディングの道具を起動するコマンドがあります。Claude Codeは ollama launch claude で、Codex CLIは ollama launch codex で起動する形です。

起動のときに、使うモデルを選びます。道具とモデルをつなぐ設定は、Ollamaが行う仕組みです。

Claude CodeでローカルLLMを使う方法|Ollama連携の手順と注意点

小さな作業で動作を確かめる

最初は、練習用のフォルダで小さな作業を頼みます。コードの説明や、1つの関数の修正など、結果を確かめやすい作業から試してください。

回答の質と速度が、用途に足りるかを確かめます。

ローカルLLMのコーディングに必要なスペック

必要なスペックは、以下の3つで押さえます。

  • モデルの容量に加えて文章を扱う分のメモリが要る
  • コーディング向けのモデルは24GB以上のメモリが目安になる
  • 16GBのPCは短いコードの生成にとどめる

モデルの容量に加えて文章を扱う分のメモリが要る

コンテキストの長さを大きくすると、必要なメモリが増えます。Ollamaの公式ドキュメントも、設定を大きくする前に、GPUのメモリが足りるかを確かめるよう注意しています。

コーディングでは、モデルの容量ちょうどのメモリでは足りません。

コーディング向けのモデルは24GB以上のメモリが目安になる

表のモデルの容量は、14GBから23GBです。文章を扱う分を加えると、24GB以上のメモリか、同じ程度のGPUのメモリが目安になります。

Qwen3.6の35bなど、容量が20GBを超えるモデルは、さらに余裕のある機器が必要です。

ローカルLLMに必要なスペック!メモリとGPUの目安・PCの選び方を解説

16GBのPCは短いコードの生成にとどめる

メモリが16GBのPCでは、コーディングの道具とつないだ使い方は厳しくなります。小さなモデルで、短いコードの生成や説明を頼む使い方にとどめてください。

ローカルLLMでコーディングするときの注意点

注意点は、以下の4つです。

  • 複雑な作業はクラウドのAIに及ばない
  • 道具の呼び出しに対応したモデルを選ぶ
  • 回答が遅いと作業が進まない
  • 生成されたコードは必ず確かめる

複雑な作業はクラウドのAIに及ばない

多くのファイルにまたがる変更や、設計の判断が要る作業は、ローカルのモデルでは結果が安定しない場合があります。うまくいかない作業は、扱える範囲でクラウドのAIに切り替えてください。

道具の呼び出しに対応したモデルを選ぶ

コーディングの道具は、ファイルの読み書きやコマンドの実行を、モデルからの呼び出しで行います。Ollamaの公式ドキュメントは、対応したモデルで道具を使えると説明しています。

対応していないモデルでは、ファイルの編集などが動きません。

回答が遅いと作業が進まない

コーディングでは、AIがファイルの読み取りと書き換えを何度も繰り返します。1回の回答が遅いと、全体の作業に長い時間がかかります。

試した結果が遅すぎる場合は、1つ小さなモデルに替えるか、PCの構成を見直してください。

生成されたコードは必ず確かめる

ローカルのモデルが書いたコードにも、誤りが含まれます。動かして確かめ、業務で使うコードは、内容を判断できる人が確かめてください。

AIコードレビューとは?できることと主なツール・導入の進め方を解説

ローカルLLMのコーディングのよくある質問

よく出る疑問は、以下の4つです。

  • 無料で使えますか?
  • Claude Codeで使えますか?
  • どのモデルがおすすめですか?
  • クラウドのAIとどう使い分ければよいですか?

無料で使えますか?

モデルとOllamaは、無料で使えます。かかる費用は、PCの購入費と電気代です。

Claude Codeで使えますか?

使えます。Ollamaには、Claude Codeをローカルのモデルとつないで起動するコマンドがあります。

コンテキストの長さを、6万4,000トークン以上に設定してから使ってください。

どのモデルがおすすめですか?

メモリに余裕がある場合は、Qwen3.6かQwen3-Coderが候補です。メモリが少ない場合は、gpt-ossの20bから試してください。

クラウドのAIとどう使い分ければよいですか?

社外に出せないコードを扱う作業をローカルLLMに任せ、ほかの作業はクラウドのAIに任せる分け方が現実的です。会社のルールで、どのコードをどちらで扱うかを決めておきましょう。

ローカルLLMのコーディングは小さな作業から試しましょう

ローカルLLMのコーディングは、コードを外部に送らずにAIを使える方法です。Ollamaで、Claude CodeやCodexをローカルのモデルとつないで使えます。

まずは、PCのメモリに収まるモデルを入れてコンテキストの長さを設定し、小さな作業から試しましょう。性能と速度が足りない作業は、クラウドのAIと使い分けてください。

この記事の監修者

中島大介(なかじ)

中島大介(なかじ)

株式会社メリル 代表取締役 / 記事監修

株式会社メリル代表取締役。SEO歴20年以上。最新AIやセキュリティについて発信するYouTube「ウェブ職TV」は登録者15万人以上。著書「ChatGPT & Copilotの教科書」は10万部突破!

プロフィールを見る

関連する記事

ローカルLLMのスペックのアイキャッチ
AIツール活用

ローカルLLMに必要なスペック!メモリとGPUの目安・PCの選び方を解説

ローカルLLMのスペックを知りたい方は必見!この記事では、必要なメモリとGPUの目安・MacとWindowsのPCの選び方を解説します。実は、メモリが16GBのPCでも小さなモデルは試せます。記事を読めば、手持ちのPCで動くかがわかります。

中島大介(なかじ)監修 / Touch AI編集部12 分で読めます
ローカルLLMのアイキャッチ
AIツール活用

ローカルLLMとは?クラウドAIとの違いやメリット・できることを解説

ローカルLLMを知りたい方は必見!この記事では、ローカルLLMの意味とクラウドAIとの違い・メリットとデメリット・できることを解説します。実は、モデルも実行するソフトも無料で入手できます。記事を読めば、自社で使うべきかがわかります。

中島大介(なかじ)監修 / Touch AI編集部16 分で読めます
AIコードレビューのアイキャッチ
AIツール活用

AIコードレビューとは?できることと主なツール・導入の進め方を解説

コードレビューのAIを知りたい方は必見!この記事では、AIコードレビューでできることと主なツール・導入の進め方を解説します。実は、GitHubも人のレビューで補うよう案内しています。記事を読めば、自社に合う使い方がわかります。

中島大介(なかじ)監修 / Touch AI編集部16 分で読めます

次のステップ

最新動向を学びに変える

話題のAIアップデートを、現役講師が背景と実務への影響まで解きほぐします。Touch AI の最新講座で、変化に追いつくための視点を得てください。

受講できる講座を見る