Jevは使いどころの選択が重要
当方が実測したデータを、確率の高さごとに見直しました。
Jevが「たぶんある」(確率0.7〜1.0)と判定しても、実際の正解率とのズレが大きいことが分かりました。「たぶんない」(確率0〜0.3)という判定は的中率こそ高いものの、全体の「あり」のうち2〜3割は、この低い確率の中に紛れ込んでいます。
- 低い確率が返ったとき:的中率は高いが、全体の見落としの2〜3割はここに含まれる
- 高い確率が返ったとき:もう一段の確認を挟むと安全
- 理由:Jevは精度ではなく、費用と速さで選ばれているAIだから
文章を書かないAIとは何か
質問と選択肢を先に決めておくと、答えと確率だけを返すAIです。詳しい仕組みは判定だけのAI、Jevを試してみたで説明しました。この記事では、その「確率」が何を語っているのかを掘り下げます。
なぜ話題になっているか
TypeSafe AIは、従来の生成AIの弱点を挙げて発表されました。創業者のDiogo Almeida氏は「モデルは会話では超人的だが、自動化はどこにあるのか」と語り、次の3点を課題に挙げています。
- 生成AIの出力は文字列なので、ソフトウェアが使うには解析と検証が要る
- 信頼度の推定が不正確で、95%成功しても失敗した1件を見分けられない
- トークン(AIが文章を処理する単位)を1つずつ生成するため遅い(当方の実測でも、生成AIは148〜275秒かかりました)
Jevは答えを1語ずつ作らず、決めておいた「型」のついた値を一度に返す設計で対応しています。訓練方法も「RLCD」という、人の好みではなくプログラムで検証できる報酬と、確率の較正に合わせる方式です。
TypeSafe AIは、公表ベンチマークで速さ193.6倍・費用444.6倍の改善を掲げています(「実世界での利益の上限」という注記付き)。

想定されている使い道は、ワークフローの自動化(分類・振り分け・採点)、大量データの処理、即答が要るリアルタイム処理、そして生成AIの出力を見張る「監視役」です。ゲームAIや経路探索のデモで、この速さを示しています。
話題になっている理由は「賢さ」ではなく、答えの形を絞ることで実現した速さと安さです。
→ くわしくは「AI格差はもう始まっている|使う会社と使わない会社」で解説しています。
「あり」の確率は何を語っているのか
Jevは「安全に関わる記述があるか」のような質問に対し、「あり」の確率を0〜1の1つの数字だけで返します。
この数字は、公式が別に定義する「確信度(confidence)」とは違うものです。確信度は選択肢や段階の判定(Choice・Score)に付きますが、今回のような「あり・なし」の判定(Noul)には確信度が付きません。
- 確率0.86:「あり」寄りの判定(=たぶんある)
- 確率0.14:「なし」寄りの判定(=たぶんない)
- 確率0.5付近:「あり」か「なし」か、Jev自身も迷っている状態
Jevが返す確率は、公式の説明では「較正(キャリブレーション)」されています。公式ドキュメントを読んで、当方は次のように理解しました。
確率は、個々の答えの正しさを保証するものではなく、大量の予測を集めたときに、確率の値と実際の正答率が一致するように調整されている
天気予報の「降水確率70%」と同じ考え方です。1回の予報が当たるかは分かりません。ただ、「降水確率70%」と言われた日を100回集めれば、およそ70回は雨が降る、という調整のされ方です。
当方の実測:「あり」の確率帯別に見た正解率
Jevが返す確率は、Jev全体が何%当たるかという正解率ではなく、その1件についてJevがどれだけ「ありそう」と見ているかという自己申告です。
記事1で扱ったのは、この自己申告をどこで区切って「あり・なし」と決めるか(しきい値)でした。ここで見るのは別の切り口です。
自己申告の数字が、実際の正解とどれだけ合っているかを確かめます。0.9という自己申告が出たときに、本当に9割方の確からしさなのかを見ていきます。
記事1で使った日報100件・3項目(安全・遅れ手戻り・客先連絡、正解「あり」は合計50件)の判定を、自己申告の確率帯ごとにまとめ直しました。
| 確率帯 | 件数 | 実際に「あり」だった割合 | 平均確率 |
|---|---|---|---|
| 低(0.0〜0.3・なし寄り) | 209件 | 5.3% | 0.11 |
| 中(0.3〜0.7・迷い) | 40件 | 42.5% | 0.48 |
| 高(0.7〜1.0・あり寄り) | 51件 | 43.1% | 0.86 |
低い確率帯は的中率が高い一方、全体の「あり」50件のうち11件(22%)はこの低い確率帯に含まれています(見落とし)。
高い確率(0.7〜1.0)は、平均0.86の自己申告に対し、実際に「あり」だったのは43.1%でした。 渡し方を直した後の測り直しでも、同じ向きが出ています(平均0.87に対し、実際は56.1%・低い確率帯の見落としは13件・26%)。
確率0.7〜1.0の行は51件(直した後は41件)ありました。このうち13件は同じ日報から2項目が重なって入っており、厳密には独立した51回の試行とは言えません。
それでも、平均確率0.86に対して実際の的中が43.1%という差は、無視できない大きさです。 断定的な統計計算は避けますが、渡し方を変えた2つの独立したデータでも、高いほどズレるという同じ向きが出ています。

今回の条件(日本語の建設日報・この3項目)では、平均確率と実際の割合の差が大きく出ました。
そのため、公式が説明する「大量に集めれば確率と実際の正答率が一致する」という性質が、そのままでは当てはまっていない可能性があります。 ただし、これは今回のデータに限った観察です。Jev全般で、常にこの性質が壊れていると一般化はできません。
大量データの傾向を掴む用途には向くのか
「個々は不正確でも、大量に集めれば全体の割合は当たるのでは」という見方もできます。これを確かめるため、300件分の確率をすべて足し合わせ、「あり」の推定件数を計算しました。
| 実際の「あり」件数 | 確率の合計(推定件数) | |
|---|---|---|
| 直す前 | 50件(16.7%) | 85.5件(28.5%) |
| 直した後 | 50件(16.7%) | 73.0件(24.3%) |
全体の割合として見ても、実際より約12ポイント(直した後は約8ポイント)多く見積もっていました。
ただし、これも300件という小さいデータでの結果です。 需要予測やアンケート集計のような、もっと大量のデータで同じ傾向が続くかどうかは、今回の実測だけでは判断できません。
公式データも認める限界
TypeSafe AI自身の評価サイトでも、Jevは常に最上位というわけではありません。
この評価の「正解」は人ではなく、GPT-6 AstraとClaude Fable 5.1という2つのAIモデルの回答を平均した参照回答です(当方の実測は人が正解を付けています。測り方が違う点にご注意ください)。
参考として、4つの業務(セキュリティ対応・エージェント追跡・請求書処理・カスタマーサービス)で、Claude Opus 5と比べた正答率を並べます。
| 業務 | Jev | Opus 5 |
|---|---|---|
| セキュリティ対応 | 61.7% | 66.2% |
| エージェント追跡 | 71.6% | 75.2% |
| 請求書処理 | 61.8% | 78.4% |
| カスタマーサービス | 76.0% | 72.4% |
4業務のうち3業務でOpus 5が上回り、Jevが勝ったのはカスタマーサービスだけでした。
ただし費用は、2026年9月時点の公表価格で、請求書処理でJevが1件0.16円、Opus 5が1件約73円と、440倍近い差があります(1ドル150円換算)。精度で選ぶAIではなく、費用と速さで選ぶAIだと、公式データ自身が示しています。
第三者による解説(DataCamp)も、同じように注意点を述べています。ベンチマークはTypeSafe AI社内で作られたものです。
参照回答がOpenAI・Anthropic製モデルに由来する点を「偏りが存在する可能性」と指摘し、「大規模な独立した再現はまだ出ていない」としています。また、「規制対象ドメインの監査のような場面では、確信スコア単体では足りない」とも述べています。
TypeSafe AIの公式ドキュメントも、日本語を含む英語以外の言語について「自身のコンテンツで検証し、信頼度スコアに注意を払うこと」と勧告しています。今回の実測は、まさにこの勧告どおりの結果になりました。
判定だけのAIに向く仕事
今回の実測と公開情報から、次の仕事には向くと分かります。
| こんな仕事 | 現場での例 |
|---|---|
| 同じ質問を、大量の文章に繰り返す | 毎日の日報の備考に「安全に関わる記述があるか」を聞く/問い合わせメールを「見積依頼・不具合・その他」に分ける |
| 1件の文章に、複数の観点を同時に尋ねる | 1件の日報に「安全・遅れ・客先連絡」を同時に聞く/1件のクレームに「担当部署・緊急度・返信が要るか」を聞く |
| 大量の行に、人が確認する順番をつける | 100件の日報を確率の高い順に並べて上から読む/検品コメントやクレーム一覧の確認順を決める |
| 精度より、費用と速さが大事な仕事 | 1日に数千件流れて人が全部は読めない文章の、一次仕分け |
どれも、答えの候補(あり/なし・段階・選択肢)を先に決められる仕事です。当方の実測では、日報100件の判定が0.4円・39秒で終わりました。
渡す文を変えると、狙っていない項目の判定まで動きます。公式ドキュメントは、判定に関係のない文が混ざると精度が落ちると書いています。ただし当方が客先連絡の条件文を安全の判定から外したときは、無関係なはずの緊急度の判定が逆に悪くなりました(記事1)。どの文をどの質問に渡すかは、実際に測って決めます。
Jevは、行を消さずに優先順位をつける道具として使うAIです。 「たぶんない」は的中率が高いものの、全体の見落としの2〜3割を含みます。そのため、確認対象から完全に外すのではなく、優先順位を下げるだけに留めます。
判定だけのAIに向かない仕事
Jevの公開情報から、次の仕事には向かないと分かります。
| 向かない仕事 | 現場での例 | 代わりに使うもの |
|---|---|---|
| 計算・数える・日付を比べる | 備考に部材が何点出てくるかを数える/納期が今週内かを判定する | プログラム |
| 否定や間接的な言い回しが多い文 | 「特記事項なし」「前回と同様」が並ぶ備考欄 | 帳票の書き方を決める・人が読む |
| 理由の説明が必要な判断 | 検査で不合格にした理由を記録に残す/監査で根拠を求められる | 生成AIか人 |
| 要約・返信・報告書の作成 | 日報から週報を作る/クレームへの返信文を用意する | 生成AIか人 |
| 画像・音声・動画 | 紙の日報を撮った写真/手書きの検査票/電話の録音 | 先に文字にする別のAI |
どれも公式ドキュメントが弱点として挙げているものです。
データの送り先
Jevは米国で動くサービスです。公開されている方針では、入力を学習に使わず、サービス提供者以外の第三者には渡さないとしています。具体的な保存日数は明記されていません。
社外へ送らずに試す道として、手元で動く公開実装「kev」もあります(Apache-2.0ライセンス)。作者の測定では、同じ評価データ(開発用)で比較すると、Kev-9B(32GBのMacで動く大きさ)が精度0.822、Jevが0.857でした。
Jevがやや上回りますが、大きな差ではありません。ただし当方は未検証で、日本語で使えるかは分かりません。
FAQ
実測では逆でした。低い確率(なし寄り)は的中率が高いものの、全体の見落としの2〜3割はここに含まれます。高い確率(あり寄り)は、自己申告ほど実際とは一致していませんでした。
今回の実測(300件分)では、全体の割合として見ても実際より多く見積もっていました。ただし、もっと大量のデータでどうなるかは、この実測だけでは判断できません。
話題になった理由は精度ではなく、費用と速さです。公式の評価データでも、4業務中3業務でClaude Opus 5に精度で劣っています。それでも費用は440倍近く安く済みます。
- Jevの確率は、高いほど実際とのズレが大きい。低い確率も的中率は高いが、全体の見落としの2〜3割を含む(当方の実測)
- 公式の評価サイトでも、Jevは4業務中3業務でOpus 5に精度で劣る(参照回答はAIが作成)。選ぶ理由は費用と速さ
- 第三者による解説も、参照回答の偏りと、確信スコア単体では足りない場面があることを指摘している
- 公式も、英語以外では信頼度スコアに注意するよう勧告しており、今回の日本語実測はその通りの結果だった
- 「たぶんない」という判定は的中率が高いが見落としもある。「たぶんある」という判定はもう一段の確認を挟む
手元のデータでJevの確率を測るときは、確率の高低ごとに実際の正解率を分けて見る。
自社の業務に合わせたAIツールの選定・導入は、ぜひ、ジッソウLABのゲンバAIへ無料でご相談ください。
この記事の内容が「自社でもいけるか」は、1分の無料診断で確かめられます。
個別の事情は無料相談でどうぞ(売り込みはしません)。



コメント