夜明けの山々を映す静かな湖面

ローカルLLMをJev的思想で爆速化、分かった4つの癖

判定専用のAI「Jev」には、「AIに文章を書かせず、決まった候補から選ばせる」という考え方があります。この記事では、これをJev的思想と呼びます。Jev的思想で、手元のMacで動く小さなAI(ローカルLLM)への聞き方を変えると、押すボタンを選び直す判断が、3.6秒から0.13秒になりました。作文させずに選ばせただけで、約27倍の速さです。費用は0円です。ただし、使い込むうちに4つの癖が見つかりました。確信度が高くても間違える、否定の文に弱い、候補の並びに引っぱられる、長い文の意図を読めない、の4つです。

AIを開発や自動テストに組み込みたい方に向けて書きます。まず、「選ばせる」という考え方と、私の環境を説明します。次に、それを道具にして3つの仕事に使った結果を紹介します。最後に、見つかった4つの癖と手当てをまとめます。

全体像:作文させるか、選ばせるか

きっかけはJevと、2本の記事

Jevは、米国のTypeSafe AIが2026年9月に発表した判定専用のAIモデルです。ChatGPTのようなAIと違い、文章を書きません。「はい/いいえ」や「選択肢のどれか」で答え、どのくらい確信があるかを数値で返します。Jevそのものの説明は、前の記事にまとめています。

このJevを使った記事を2本読みました。

Jevはクラウドの有料サービスです。私は「費用0円・通信は手元のMacの中だけ」で使いたかったので、手元のモデルで同じ形を作れるかを試しました。

小論文とマークシート

違いは、1本目の記事にあった試験のたとえを借りると分かりやすいと思います(図1)。作文させるのは、小論文の試験です。AIは白紙に文章を書き、こちらはそれを読んで答えを取り出します。選ばせるのは、マークシートの試験です。AIは、候補に振った記号(A、B、C……)を1つ塗るだけです。

作文させる使い方と、選ばせる使い方の比較図。作文させると、AIは「保存ボタンを押すのがよいと考えます」のような文章を書き、こちらはそこから答えを読み取る。選ばせると、AIは候補の記号Bの1語だけを答え、B 0.97・A 0.02・C 0.01のような確率から、決めるか人に回すかを決められる
図1:作文させると、選ばせる(図を押すと拡大します)

AIは文章を書くとき、次に来る語の確率を計算しながら、1語ずつ書いています。選ばせる場合は、最初の1語(記号)の確率を読めば、それがそのまま答えと確信度になります。1語で終わるので速く、候補の外を答えることもありません。確率が低ければ「迷っている」と分かるので、そのときだけ人に回せます。

手元の環境

使ったのは次の環境です。

  • Mac(M5 Max・メモリ128GB)と、AIを動かすソフトのOllama(0.35.1)
  • 小さいモデル:gemma-4-E4B(約8GB。以下E4B)
  • 大きいモデル:Qwen 27B(約25GB。以下27B)

このMacには、Claude Codeとは別に、HERMESというAIエージェントがいます。私が作っているゲームの開発とテストは、HERMESに任せています。今回の道具には、HERMESのテストを速くする狙いもありました。

手元で測った:作文させる聞き方と比べる

どんな試験か:押し先の選び直し

最初に、2本目の記事と同じ形の試験をしました。

自動テストの道具Playwrightでは、テストを「『Back up now』という名前のボタンを押す」のように書きます。画面の文言が「Create recovery copy」に変わると、テストは押す先を見失って落ちます。このとき、今の画面にあるボタンから、押すべきものを選び直させるのが「押し先の選び直し」です。

2本目の記事の作者は、試験に使ったデモ画面とソースを公開しています(デモ画面・リポジトリ)。ただし、私の試験はこのリポジトリを動かしたものではありません。同じ形の場面を16個、自分で作りました。画面は公開していないので、URLはありません。

試験のしかたは次のとおりです。

  • 画面:Playwrightで開いた白紙のページに、ボタンを4つ並べただけのHTML
  • AIに渡すもの:元のボタン名と、そのボタンの働き(例:「新しいバックアップを作る」)、今の画面のボタンの一覧
  • 正解:働きが同じボタン。正解のボタンが消えた場面(16個のうち2個)では、「どれでもない」を選べば正解
  • 回数:16の場面を、ボタンの並びを3通りに替えて、計48回(記事も、16の変種を3回ずつで48回)

「Back up now」の場面で使った画面は、図2のとおりです。見た目を整えていない、ボタンだけのページです。

試験に使った画面。白いページに、Create recovery copy・Restore recovery copy・Delete all copies・Settingsの4つのボタンが横に並んでいるだけ
図2:「Back up now」の場面で使った画面(Playwrightで開いて撮影)

HTMLは、次のようにボタンを並べただけです(実物は、これに文字コードの指定を付けて1行にしたもの)。

<main>
  <button>Create recovery copy</button>
  <button>Restore recovery copy</button>
  <button>Delete all copies</button>
  <button>Settings</button>
</main>

AIには、この画面にあるボタンの一覧と、「元は『Back up now』という名前で、新しいバックアップを作るボタンだった」ことを渡します。正解は「Create recovery copy」です。隣の「Restore recovery copy」(復元する)は、単語が似ていても働きが逆です。

場面の例を表1に挙げます。1行目は記事と同じ例で、残りは私が作りました。

元のボタン名 ボタンの働き 変わった後の正解 一緒に並べたボタン
Back up now 新しいバックアップを作る Create recovery copy Restore recovery copy/Delete all copies/Settings
Delete account アカウントを削除する Close my account Log out/Edit profile/Download my data
保存 設定の変更を保存する 変更を保存 変更を破棄/初期設定に戻す/閉じる
Archive 記事をアーカイブにしまう (消えた。「どれでもない」が正解) Publish/Edit/Preview

表1:押し先の選び直しの場面の例(16個のうち4個)

結果:同じMacで、作文させるより27倍速かった

同じMacで、同じ48回を、3通りの聞き方で比べました(表2)。作文させる聞き方では、AIに「どれを押すべきか、理由も書いて。無ければそう書いて」と頼み、自由な文で答えてもらいました。渡す材料は、選ばせる場合と同じです。

判断役と聞き方 正しく選べた 人に回した 誤り・どちらとも読める 判断時間の中央値
手元:小さいAI(E4B)に選ばせる 48回中43回 5回 0回 0.13秒
手元:小さいAI(E4B)に作文させる 48回中42回 ― 誤り4回・どちらとも読める2回 3.58秒
手元:大きいAI(27B)に作文させる 48回中48回 ― 0回 5.83秒
記事:Jev(クラウド) 48回中48回 ― ― 0.275秒
記事:GPT-5.5(クラウド) 48回中48回 ― ― 3.81秒

表2:押し先の選び直し48回。手元の3通りは2026年10月7日に、場面ごとに3通りを続けて測った値(選ばせる方のしきい値は0.95)。JevとGPT-5.5は記事の値で、記事の作者が自分の16変種で測ったもの

実際の速さの差を、録画で見てください(図3)。左が作文させる聞き方(AS-IS)、右が選ばせる聞き方(TO-BE)です。同じ画面・同じ材料を、同じ小さいAIに渡しています。時計は、AIに聞いた瞬間に動き出し、答えが返った瞬間に止まります。AIの答えも時間も、実際に動かしたものをそのまま映しています。

図3:同じMac・同じ小さいAIでの速さ比べ(2026年10月7日・1回の実際の速さ・音は出ません)。この1回は2.43秒と0.05秒で、表2の48回の中央値(3.58秒・0.13秒)より短めでした

同じ小さいAIで比べると、選ばせる聞き方は作文させる聞き方の約27倍速く、誤りは0回でした。作文させると、1回の答えに約250トークン(文章の長さの単位)を書きます。選ばせると、答えは記号1文字です。

ただ、いちばん正確だったのは、大きいAIに作文させた聞き方でした。48回とも正しく、正解のボタンが消えた場面でも、6回とも「同じ働きのボタンはありません」と答えました。小さいAIに作文させると、この6回で「Publish(公開)を押すべき」と誤ったり、「見当たりません。ただ、最も近いのはSaveかClose」と、どちらとも読める答えを返したりしました。選ばせる聞き方は、迷った5回を人に回しています。速さと引き換えに、自信のないものは自分で決めない、という形です。

もう1つ、作文の答えを読み取る手間も、そのまま出ました。作文の答えは、理由の中で候補を全部説明するので、どの答えにもボタンの名前が2つ以上出てきます。そのため、プログラムでは「どれを選んだか」を取り出せず、96件の答えを私が目で読んで判定しました。選ばせる聞き方なら、答えは記号1つなので、この手間がありません。

記事のJevと比べても、判断時間は短くなりました。ただし、手元のモデルには通信の時間がありません。クラウドのJevと比べると、そのぶん有利な比較です。また、場面が同じではないので、正しく選べた数は並べて比べられません。前日に、選ばせる聞き方だけを続けて測ったときは、中央値は約0.09秒でした。今回は作文と交互に流したので、少し遅くなっています。

なお、記事の分類を聞く4択の問い(候補は「AI・仕事術・学び・遊び」)を、同じ問いのまま20回くり返すと、判断時間の中央値は31ミリ秒でした。場面ごとに問いが変わる上の試験より速いのは、Ollamaが前回の計算の一部を使い回せるためと考えられます。

道具にした:芯と3つの部品

「答えの候補が先に決まっている判断」は、身の回りに多くありました。そこで、選ばせる仕組みを芯にして、用途ごとの部品を付けた道具を作りました(図4)。

判定の道具の流れ図。候補と説明文を付けた問いを、まず小さいモデル(E4B)に選ばせ、確信度が足りれば決める。足りなければ大きいモデル(27B)に回し、それでも足りなければ人に回す
図4:小さいモデル → 大きいモデル → 人の二段構え(図を押すと拡大します)

芯の流れは二段構えです。まず小さいモデルに選ばせ、確信度がしきい値(たとえば0.9)以上なら決めます。足りなければ、大きいモデルに同じ問いを回します。それでも足りなければ、人に回します(手紙の場合は、HERMESが読みます)。

部品は3つです。

  1. 画面のテスト:前に書いた押し先の選び直しと、「保存できたと表示されているか」の判定をする部品です
  2. Obsidianの整理:私はWebの記事をObsidian(メモアプリ)に集め、26のテーマに振り分けています。新しい記事の行き先を、テーマの上位3つと確信度で提案します。記事には、26のテーマとは別に、4つの大分類(AI・仕事術・学び・遊び)も付けています
  3. 手紙の振り分け:私とHERMESは、ファイルに書いた手紙でやり取りしています。届いた手紙が「知らせだけ」「返事を求める」「作業を頼む」のどれかを判定します

それぞれの部品を、次の試験で確かめました(表3)。どれも2026年10月6日に、手元のMacで行いました。

試験 使ったもの AIに聞いたこと 正解
押し先の選び直し 自作の簡単な画面(ボタン4つ)。16場面×並び3通り=48回 元のボタン名と働きを渡し、今のボタンから選ぶ 自分で決めた正しいボタン(消えた場面は「どれでもない」)
画面の判定 文を1つだけ出した自作の画面20個(はっきりした16個・曖昧な4個) 「ログインできている」などの文が、画面に合うか 自分で決めた答え(曖昧な画面は「人に回す」が正解)
Obsidianの提案 26のテーマのまとめノートからリンクされている、過去の記事420件 記事の題と説明から、26のテーマのどれに入るか 過去に振り分けたテーマ
手紙の振り分け HERMESとやり取りした手紙60通 返事が要るか・作業を頼んでいるか 別のAIが付けた答え

表3:部品ごとの試験

Obsidianの試験では、テーマごとに、まとめノートの冒頭と、そのテーマに入っている記事の見出し12個を、説明として渡しました。測る記事自身の見出しは、答えが漏れないよう説明から抜いています。

いまの問題:確信度が高ければ正しいのか

選ばせる方式の売りは、迷いが数字で見えることです。確信度が高いものだけ自動で決め、低いものを人に回せば、安全に任せられそうに思えます。

ところが測ってみると、そう単純ではありませんでした。小さいモデルは、確信度0.9を超えたまま間違えることがありました。ここからは、見つかった4つの癖と、その手当てを書きます。

分かった4つの癖と手当て

1. 自信過剰:曖昧でも、高い確信度で答える

はっきりした例から書きます。「うーん、どうだろう」という感想について、「満足している」と言えるかを聞くと、E4Bは「いいえ」と答えました(確信度0.986)。「満足していない」と言えるかを聞いても、「いいえ」でした(0.934)。どちらも高い確信度で、互いに矛盾しています。

数でも見ました。最初の試しでは、Obsidianの記事420件を、テーマの説明を付けずに26のテーマへ分けさせました(正解は過去の振り分け)。E4Bが確信度0.99以上で答えた143件でも、過去の振り分けと一致したのは87%でした。ただし、食い違いの一部は正解の側の揺れです(後で書きます)。27Bは、E4Bより確信度が当たりました。4つの大分類で確信度0.9以上だけを自動で決めると、決めた分の正解は96%でした(決まったのは全体の約6割)。

手当ては4つです。

  • 候補には、名前だけでなく1行の説明を付けます。4つの大分類で、E4Bの正解は66%から81%に上がりました(420件)
  • 自動で決めてよいしきい値は、正解付きのデータで測って決めます
  • 小さいモデルで決まらなければ、大きいモデルに回します
  • 押して困る操作は、しきい値を高くします

2. 否定の文に弱い

画面の判定で、「ログインしました」と出ている画面について聞きました。E4Bは、「ログインできているか」にも「ログインできていないか」にも「はい」と答えました。はっきりした画面16件のうち、6件でこうした矛盾が起きました。

手当ては、はい/いいえで聞くのをやめることでした。「ログインできている」「ログインできていない」「どちらとも言えない」の3つの文から、合うものを選ばせます。試しの台本では、16件すべて正しくなりました。道具に組み込んだあとの測定では15件が正解で、残る1件は人に回しました(誤りは0)。2回聞いていたのが1回で済むので、144ミリ秒が36ミリ秒になりました。「処理中です……」のような曖昧な画面では「どちらとも言えない」を選び、人に回ります。

3. 候補の並びに引っぱられる

「新作RPGがSteamで配信開始」という題を、「AI」「遊び」の2択で聞きました。E4Bは「AI」と答えました(確信度0.90)。並びを逆にすると、「遊び」でした(0.76)。E4Bは、先に書かれた候補を選びやすいようです。

押し先の選び直しでも、同じ癖と見られる誤りが出ていました。しきい値を0.9にしていたときは、48回のうち3回、誤って別のボタンを選びました。「Delete account(アカウント削除)」の代わりに「Log out」を、消えた「Archive」の代わりに「Publish(公開)」を選んだのです。確信度は0.92〜0.94で、しきい値をわずかに越えていました。3回とも、候補が1通り目の並びのときでした。

手当ては用途ごとに変えました。押し先の選び直しは、しきい値を0.95に上げるだけで誤りが0になりました。手紙の振り分けでは、並びを逆にしてもう一度聞き、1位が同じときだけ決める確かめを入れました。

4. 長い文の意図を読めない

手紙60通で、「作業を頼んでいるか」をE4Bに判定させました。はい/いいえで聞く形では、判定した59通の正解は16.9%で、49通を「作業を頼んでいる」と誤りました。手紙には「測った」「直した」のように、済ませた作業の報告が多く書かれています。E4Bは、それを依頼と取り違えました。

60通の正解は、自分の道具を自分で採点しないよう、別のAIに付けてもらいました。60通のうち、返事が要るのは11通、作業を頼んでいるのは8通です。全部「要らない」と答えても8割を超えるので、正解率と一緒に、見逃しの数を見ました。

問いを「知らせだけ/返事を求める/作業を頼む/どちらとも言えない」から選ぶ形に変え、手紙の末尾も渡すと、E4Bでも作業の判定は75.8%まで上がりました。ただ、返事が要るかの判定は45.5%にとどまりました。同じ問いで27Bに替えると、返事は88.2%、作業は94.1%になりました(どれも、自信のあるものだけを決めた場合の、決めた分の正解。27Bが決めたのは約3割)。

画面の文字やボタン名は、8GBのモデルで足りました。記事の分類は、8GBのモデルで多くを決め、迷ったものだけ大きいモデルに回す形で足りました。長い文の意図は、大きいモデルでないと読めませんでした。

もう1つ:正解の側も揺れていた

Obsidianでは、2つのモデルがそろって高い確信度で答え、それでも「不正解」になった17件を見直しました。多くは、モデルの答えにも筋が通っていました。たとえば「Hermes Agent 完全ガイド」という記事は、過去に「AIエージェント製品の動向」へ振り分けていました。モデルの答えは「Hermes Agent導入事例」です。どちらも間違いとは言えません。

26のテーマが重なり合っていて、過去の振り分けのほうが揺れていたのです。そこで目標を、「1位が正解と一致する」から「上位3つに正解が入る」に変えました。

結果

手当てを入れたあとの結果です(表4)。

用途 結果 1回の時間
押し先の選び直し(16場面×並び3通り=48回) 正しく選び直す43回・人に回す5回・誤り0回 約0.09〜0.13秒(E4B)
画面の判定(はっきりした16件・曖昧な4件) はっきりした画面で正解15件(残る1件は人に回す)・曖昧な画面で「はい」0件 約36ミリ秒(E4B)
Obsidianの提案(過去の420件) 上位3つに正解が入る90.2%(二段構え。E4Bだけでは86.9%) 新しい記事1件 約90ミリ秒(E4B)
手紙の「返事が要るか」(60通) 決めた13通中12通が正解(92.3%)・見逃し0 1通 2.3〜3.2秒(27B)

表4:2026年10月6日に測定(選び直しは10月7日も)。選び直しは48回の中央値(単独で測った10月6日と、作文と交互に測った10月7日)、判定は同じ画面で10回くり返した中央値、Obsidianは新しい記事91件の2件目以降の中央値、手紙は1通にかかった時間の幅

手紙は、60通のうち自動で決めたのが13通(約2割)です。残りの47通は、今までどおりHERMESが読みます。決める範囲は狭いものの、決めた中に見逃しはありませんでした。

失敗から学んだこと

  • 対策を全部に掛けたら、遅くしただけだった。 並びの確かめを、最初はすべての問いに入れました。手紙は、決めた分の正解が17通中15通から13通中12通に上がりました(88.2%→92.3%)。一方、Obsidianの提案は1件90ミリ秒から729ミリ秒に遅くなり、60件の抜き取りで上位3つに正解が入る割合も80%から75%に下がりました。並びを替えるとAIに渡す文の前半が毎回変わり、Ollamaの「前回の計算の使い回し」が効かなくなったためです。押し先の選び直しも、正しく選べる回数が43回から38回に減りました。選び直しは、もともと誤りが0でした。手紙の差は空振り1通分と小さいものの、悪くなった所は無かったので、今は手紙だけで使っています
  • 説明文の1語が、判断を引っぱるらしい。 「新作RPG」をAIと誤る件は、分類の説明を長くした問いでは、並びを替えても直りませんでした(AI 0.93)。並びではなく、「AI」の候補に付けた説明「AI・生成AI・開発ツール(Claude Code等)関連の大半」の「大半」に引っぱられたと考えられます。言い回しを直して測り直すのは、これからです
  • 渡したつもりの説明文が、渡っていなかった。 最初の試しでは、テーマの説明を読み込むつもりで、ノートの題名の行を読み込んでいました。説明文なしの数字を、説明文ありの数字だと思っていたのです。次の試しの準備で、中身を印字して気づきました。数字を出す前に、AIに渡す文を1回は目で見ることにしています

まとめ:選ばせる設計の点検表

AIに選ばせる仕組みを作るときに、私が次から確かめる項目です。

  1. 候補ごとに説明文を付けたか(4つの大分類で、名前だけ66%→説明を付けて81%)
  2. はい/いいえで、否定の文を聞いていないか。反対の文と「どちらとも言えない」から選ばせる
  3. 候補の並びで答えが変わらないか、1回は並びを替えて確かめたか
  4. 押して困るものは、しきい値を高くしたか
  5. 長い文の意図を聞くなら、大きいモデルに回すか
  6. 押したあとの結果は、AIの判定とは別の方法で確かめるか

6番は、「Jev vs GPT」の記事にもあった話です。画面に「送信しました」と出ていても、実際には送られていないことがありました。それを止めたのはAIではなく、送信件数を確かめるコードでした。

選ばせると速いのは本当でした。ただ、確信度は「自信」であって「正しさ」ではありません。どこまで任せてよいかは、正解付きのデータで測って決める必要がある、というのが今回の結論です。もちろん、これは私の手元の1台と2つのモデルでの結果です。1つの参考として見ていただければと思います。

次回予告

今回の正解は、過去の自分の振り分けでした。それ自体が揺れていると分かったので、50件に人の手で正解を付け直しています。次回は、その正解で測り直した結果と、Obsidianの整理に組み込むかどうかの判断を書く予定です。