AIの確信度をJevで実測|高い確率でも確認は必要

AIの確信度をJevで実測|高い確率でも確認は必要 AI活用の記事
結論

Jevは使いどころの選択が重要

当方が実測したデータを、確率の高さごとに見直しました。

Jevが「たぶんある」(確率0.7〜1.0)と判定しても、実際の正解率とのズレが大きいことが分かりました。「たぶんない」(確率0〜0.3)という判定は的中率こそ高いものの、全体の「あり」のうち2〜3割は、この低い確率の中に紛れ込んでいます。

費用感
記事1の実測と同じ(100件の判定で0.4円)
最初の一歩
Jevが出す確率をそのまま信頼度として使わず、まず自社のデータで確率帯ごとの正解率を測る
  • 低い確率が返ったとき:的中率は高いが、全体の見落としの2〜3割はここに含まれる
  • 高い確率が返ったとき:もう一段の確認を挟むと安全
  • 理由:Jevは精度ではなく、費用と速さで選ばれているAIだから

文章を書かないAIとは何か

質問と選択肢を先に決めておくと、答えと確率だけを返すAIです。詳しい仕組みは判定だけのAI、Jevを試してみたで説明しました。この記事では、その「確率」が何を語っているのかを掘り下げます。

なぜ話題になっているか

TypeSafe AIは、従来の生成AIの弱点を挙げて発表されました。創業者のDiogo Almeida氏は「モデルは会話では超人的だが、自動化はどこにあるのか」と語り、次の3点を課題に挙げています。

  • 生成AIの出力は文字列なので、ソフトウェアが使うには解析と検証が要る
  • 信頼度の推定が不正確で、95%成功しても失敗した1件を見分けられない
  • トークン(AIが文章を処理する単位)を1つずつ生成するため遅い(当方の実測でも、生成AIは148〜275秒かかりました)

Jevは答えを1語ずつ作らず、決めておいた「型」のついた値を一度に返す設計で対応しています。訓練方法も「RLCD」という、人の好みではなくプログラムで検証できる報酬と、確率の較正に合わせる方式です。

TypeSafe AIは、公表ベンチマークで速さ193.6倍・費用444.6倍の改善を掲げています(「実世界での利益の上限」という注記付き)。

なぜ話題になっているか

想定されている使い道は、ワークフローの自動化(分類・振り分け・採点)、大量データの処理、即答が要るリアルタイム処理、そして生成AIの出力を見張る「監視役」です。ゲームAIや経路探索のデモで、この速さを示しています。

話題になっている理由は「賢さ」ではなく、答えの形を絞ることで実現した速さと安さです。

→ くわしくは「AI格差はもう始まっている|使う会社と使わない会社」で解説しています。

「あり」の確率は何を語っているのか

Jevは「安全に関わる記述があるか」のような質問に対し、「あり」の確率を0〜1の1つの数字だけで返します。

この数字は、公式が別に定義する「確信度(confidence)」とは違うものです。確信度は選択肢や段階の判定(Choice・Score)に付きますが、今回のような「あり・なし」の判定(Noul)には確信度が付きません。

  • 確率0.86:「あり」寄りの判定(=たぶんある)
  • 確率0.14:「なし」寄りの判定(=たぶんない)
  • 確率0.5付近:「あり」か「なし」か、Jev自身も迷っている状態

Jevが返す確率は、公式の説明では「較正(キャリブレーション)」されています。公式ドキュメントを読んで、当方は次のように理解しました。

確率は、個々の答えの正しさを保証するものではなく、大量の予測を集めたときに、確率の値と実際の正答率が一致するように調整されている

天気予報の「降水確率70%」と同じ考え方です。1回の予報が当たるかは分かりません。ただ、「降水確率70%」と言われた日を100回集めれば、およそ70回は雨が降る、という調整のされ方です。

当方の実測:「あり」の確率帯別に見た正解率

Jevが返す確率は、Jev全体が何%当たるかという正解率ではなく、その1件についてJevがどれだけ「ありそう」と見ているかという自己申告です。

記事1で扱ったのは、この自己申告をどこで区切って「あり・なし」と決めるか(しきい値)でした。ここで見るのは別の切り口です。

自己申告の数字が、実際の正解とどれだけ合っているかを確かめます。0.9という自己申告が出たときに、本当に9割方の確からしさなのかを見ていきます。

記事1で使った日報100件・3項目(安全・遅れ手戻り・客先連絡、正解「あり」は合計50件)の判定を、自己申告の確率帯ごとにまとめ直しました。

確率帯 件数 実際に「あり」だった割合 平均確率
低(0.0〜0.3・なし寄り) 209件 5.3% 0.11
中(0.3〜0.7・迷い) 40件 42.5% 0.48
高(0.7〜1.0・あり寄り) 51件 43.1% 0.86

低い確率帯は的中率が高い一方、全体の「あり」50件のうち11件(22%)はこの低い確率帯に含まれています(見落とし)。

高い確率(0.7〜1.0)は、平均0.86の自己申告に対し、実際に「あり」だったのは43.1%でした。 渡し方を直した後の測り直しでも、同じ向きが出ています(平均0.87に対し、実際は56.1%・低い確率帯の見落としは13件・26%)。

確率0.7〜1.0の行は51件(直した後は41件)ありました。このうち13件は同じ日報から2項目が重なって入っており、厳密には独立した51回の試行とは言えません。

それでも、平均確率0.86に対して実際の的中が43.1%という差は、無視できない大きさです。 断定的な統計計算は避けますが、渡し方を変えた2つの独立したデータでも、高いほどズレるという同じ向きが出ています。

当方の実測:「あり」の確率帯別に見た正解率

今回の条件(日本語の建設日報・この3項目)では、平均確率と実際の割合の差が大きく出ました。

そのため、公式が説明する「大量に集めれば確率と実際の正答率が一致する」という性質が、そのままでは当てはまっていない可能性があります。 ただし、これは今回のデータに限った観察です。Jev全般で、常にこの性質が壊れていると一般化はできません。

大量データの傾向を掴む用途には向くのか

「個々は不正確でも、大量に集めれば全体の割合は当たるのでは」という見方もできます。これを確かめるため、300件分の確率をすべて足し合わせ、「あり」の推定件数を計算しました。

実際の「あり」件数 確率の合計(推定件数)
直す前 50件(16.7%) 85.5件(28.5%)
直した後 50件(16.7%) 73.0件(24.3%)

全体の割合として見ても、実際より約12ポイント(直した後は約8ポイント)多く見積もっていました。

ただし、これも300件という小さいデータでの結果です。 需要予測やアンケート集計のような、もっと大量のデータで同じ傾向が続くかどうかは、今回の実測だけでは判断できません。

公式データも認める限界

TypeSafe AI自身の評価サイトでも、Jevは常に最上位というわけではありません。

この評価の「正解」は人ではなく、GPT-6 AstraとClaude Fable 5.1という2つのAIモデルの回答を平均した参照回答です(当方の実測は人が正解を付けています。測り方が違う点にご注意ください)。

参考として、4つの業務(セキュリティ対応・エージェント追跡・請求書処理・カスタマーサービス)で、Claude Opus 5と比べた正答率を並べます。

業務 Jev Opus 5
セキュリティ対応 61.7% 66.2%
エージェント追跡 71.6% 75.2%
請求書処理 61.8% 78.4%
カスタマーサービス 76.0% 72.4%

4業務のうち3業務でOpus 5が上回り、Jevが勝ったのはカスタマーサービスだけでした。

ただし費用は、2026年9月時点の公表価格で、請求書処理でJevが1件0.16円、Opus 5が1件約73円と、440倍近い差があります(1ドル150円換算)。精度で選ぶAIではなく、費用と速さで選ぶAIだと、公式データ自身が示しています。

第三者による解説(DataCamp)も、同じように注意点を述べています。ベンチマークはTypeSafe AI社内で作られたものです。

参照回答がOpenAI・Anthropic製モデルに由来する点を「偏りが存在する可能性」と指摘し、「大規模な独立した再現はまだ出ていない」としています。また、「規制対象ドメインの監査のような場面では、確信スコア単体では足りない」とも述べています。

TypeSafe AIの公式ドキュメントも、日本語を含む英語以外の言語について「自身のコンテンツで検証し、信頼度スコアに注意を払うこと」と勧告しています。今回の実測は、まさにこの勧告どおりの結果になりました。

判定だけのAIに向く仕事

今回の実測と公開情報から、次の仕事には向くと分かります。

こんな仕事 現場での例
同じ質問を、大量の文章に繰り返す 毎日の日報の備考に「安全に関わる記述があるか」を聞く/問い合わせメールを「見積依頼・不具合・その他」に分ける
1件の文章に、複数の観点を同時に尋ねる 1件の日報に「安全・遅れ・客先連絡」を同時に聞く/1件のクレームに「担当部署・緊急度・返信が要るか」を聞く
大量の行に、人が確認する順番をつける 100件の日報を確率の高い順に並べて上から読む/検品コメントやクレーム一覧の確認順を決める
精度より、費用と速さが大事な仕事 1日に数千件流れて人が全部は読めない文章の、一次仕分け

どれも、答えの候補(あり/なし・段階・選択肢)を先に決められる仕事です。当方の実測では、日報100件の判定が0.4円・39秒で終わりました。

渡す文を変えると、狙っていない項目の判定まで動きます。公式ドキュメントは、判定に関係のない文が混ざると精度が落ちると書いています。ただし当方が客先連絡の条件文を安全の判定から外したときは、無関係なはずの緊急度の判定が逆に悪くなりました(記事1)。どの文をどの質問に渡すかは、実際に測って決めます。

Jevは、行を消さずに優先順位をつける道具として使うAIです。 「たぶんない」は的中率が高いものの、全体の見落としの2〜3割を含みます。そのため、確認対象から完全に外すのではなく、優先順位を下げるだけに留めます。

判定だけのAIに向かない仕事

Jevの公開情報から、次の仕事には向かないと分かります。

向かない仕事 現場での例 代わりに使うもの
計算・数える・日付を比べる 備考に部材が何点出てくるかを数える/納期が今週内かを判定する プログラム
否定や間接的な言い回しが多い文 「特記事項なし」「前回と同様」が並ぶ備考欄 帳票の書き方を決める・人が読む
理由の説明が必要な判断 検査で不合格にした理由を記録に残す/監査で根拠を求められる 生成AIか人
要約・返信・報告書の作成 日報から週報を作る/クレームへの返信文を用意する 生成AIか人
画像・音声・動画 紙の日報を撮った写真/手書きの検査票/電話の録音 先に文字にする別のAI

どれも公式ドキュメントが弱点として挙げているものです。

データの送り先

Jevは米国で動くサービスです。公開されている方針では、入力を学習に使わず、サービス提供者以外の第三者には渡さないとしています。具体的な保存日数は明記されていません。

社外へ送らずに試す道として、手元で動く公開実装「kev」もあります(Apache-2.0ライセンス)。作者の測定では、同じ評価データ(開発用)で比較すると、Kev-9B(32GBのMacで動く大きさ)が精度0.822、Jevが0.857でした。

Jevがやや上回りますが、大きな差ではありません。ただし当方は未検証で、日本語で使えるかは分かりません。

FAQ

確率が高いほど信頼できるのではないですか

実測では逆でした。低い確率(なし寄り)は的中率が高いものの、全体の見落としの2〜3割はここに含まれます。高い確率(あり寄り)は、自己申告ほど実際とは一致していませんでした。

大量のデータなら確率は信頼できますか

今回の実測(300件分)では、全体の割合として見ても実際より多く見積もっていました。ただし、もっと大量のデータでどうなるかは、この実測だけでは判断できません。

なぜ話題になっているのに、精度は一番ではないのですか

話題になった理由は精度ではなく、費用と速さです。公式の評価データでも、4業務中3業務でClaude Opus 5に精度で劣っています。それでも費用は440倍近く安く済みます。

まとめ

  • Jevの確率は、高いほど実際とのズレが大きい。低い確率も的中率は高いが、全体の見落としの2〜3割を含む(当方の実測)
  • 公式の評価サイトでも、Jevは4業務中3業務でOpus 5に精度で劣る(参照回答はAIが作成)。選ぶ理由は費用と速さ
  • 第三者による解説も、参照回答の偏りと、確信スコア単体では足りない場面があることを指摘している
  • 公式も、英語以外では信頼度スコアに注意するよう勧告しており、今回の日本語実測はその通りの結果だった
  • 「たぶんない」という判定は的中率が高いが見落としもある。「たぶんある」という判定はもう一段の確認を挟む

次の一歩手元のデータでJevの確率を測るときは、確率の高低ごとに実際の正解率を分けて見る。

自社の業務に合わせたAIツールの選定・導入は、ぜひ、ジッソウLABのゲンバAIへ無料でご相談ください。

大平

執筆・監修

大平 — ジッソウLAB代表

中小企業の業務改善・メルカリ物販、中古PC販売の実務経験を活かし、現場目線でAI活用を検証・発信

NEXT ACTION

この記事の内容が「自社でもいけるか」は、1分の無料診断で確かめられます。
個別の事情は無料相談でどうぞ(売り込みはしません)。

コメント

タイトルとURLをコピーしました