判定だけのAI、Jevを試してみた|出番が少ない理由

判定だけのAI、Jevを試した|出番が少ない理由 AI活用の記事

結論

判定だけのAIが入る隙間は、思ったより狭い

当方が仮の建設日報100件で試したところ、安全に関わる記述10件のうち6件を見落としました。渡し方を直すと見落としは3件に減りましたが、同じ直しで、急ぐ案件の見落としが11件から21件に増えました。 任せる先は次のように分かれます。

  • 機械的に決まること:プログラム
  • 言葉の意味を読むこと:生成AI
  • 最後の決定:人
費用感
100件の判定で0.4円。ただし仕組みを作る手間と、人が確かめる時間は別
最初の一歩
手元の日報の備考を20枚読み、人へ回す記述と、読んでも判断できない記述を分ける

文章を作らないAIとは何か

質問と選択肢を先に決めておくと、答えと確率だけを返すAIです。文章は書きません。

TypeSafe AIが2026年9月15日に発表した「Jev」が、その第1号として公開されています。尋ね方は3つあります。

尋ね方 返るもの 日報での使い方
はい・いいえ 0〜1の確率 安全に関わる記述があるか
段階評価 順序のある数値 緊急度が3段階のどれか
選択 候補から1つ あらかじめ決めた分類のどれか

2026年9月時点の公表価格は、入力100万トークン(AIが文章を処理する単位)あたり0.042ドルで、出力は無料です。当方が実測した応答は、1件あたり0.2〜0.6秒でした。

答えの候補を先に書き出せる仕事だけが対象になります。書き出せない仕事は、この種類のAIでは扱えません。

当方の実測:日報100件を3つのAIに判定させると何が起きたか

ここでは判定だけのAIに、上記の「Jev」を使って実測してみました。

仮の建設日報を100件作り、備考の文だけを渡しました。現場を知る担当者が、AIの答えを見る前に正解を付けています。判定するのは「安全に関わる記述があるか」「遅れや手戻りがあるか」「客先への連絡が要るか」の3つと、緊急度の3段階です。

なお、この記事では、人の正解が「あり・要る」なのにAIが拾えなかったことを「落とす」、人の正解が「なし・不要」なのにAIが「あり・要る」としたことを「拾いすぎ」と呼びます。落とした行は、抽出した行だけを読む運用では人の目に触れませんが、拾いすぎた行は人が読んで外せます。

それぞれの項目で拾えた実数をまとめた表が、下のとおりです。

安全 遅れ手戻り 客先連絡 記録だけ 今日中 今週中
正解 10件 19件 21件 71件 25件 4件
Jev 4件 5件 7件 51件 14件 4件
生成AI・Haiku 9件 17件 16件 54件 6件 3件
生成AI・Opus 9件 16件 15件 57件 20件 4件

安全・遅れ手戻り・客先連絡は「正しく拾えた件数」、記録だけ・今日中・今週中は「正しく言い当てた件数」です。

拾った件数だけを見ると、Jevは安全・遅れ手戻り・客先連絡のどの項目でも正解の半分に届きません。Jevは落とす誤りが多いことが分かります。

費用はJevがOpusの130分の1で済み、7倍速く終わりました。安さと速さは公表のとおりです。

費用 時間
Jev 0.4円 39秒
生成AI・Haiku 11円 148秒
生成AI・Opus 49円 275秒

次の表は、Jevの設定を1つ決めたうえでの数字です。返ってくるのは確率なので、いくつ以上を「あり」と見なすかは、こちらで決められます。 当方は0.1刻みで全部試し、誤りがいちばん少なかった0.9を選びました。

数字は安全・遅れ手戻り・客先連絡の3項目合計です(正解の「あり」は合計50件)。

「あり」と見なす確率 取りこぼし(3項目合計) 拾いすぎ(3項目合計)
0.1以上 2件 133件
0.5以上 19件 38件
0.9以上(表の数字) 34件 6件

設定を低くすれば、ほとんど落としません。ただし133件を拾いすぎるため、100件のうち大半を人が読み直すことになり、仕分けの意味がなくなります。

この調整ができるのはJevの利点です。生成AIは「あり」か「なし」を直接返すため、同じようには動かせません。

ただし、同じだけ落とす設定にそろえても、差は残ります。

取りこぼし(3項目合計) 拾いすぎ(3項目合計)
Haiku 8件 50件
Jev(0.2以上) 8件 81件
Opus 10件 34件
Jev(0.3以上) 11件 52件

取りこぼしをそろえると、Jevは1.5倍ほど多く拾いすぎました。設定で寄せられるのは誤りの向きであって、判定そのものの細かさではありません。

日報100件の本文、人が付けた正解、3つのAIの判定は実測データのページにすべて載せました。落とした行がどんな文だったかも、そこで読めます。

拾いすぎの数も調べました。Jevは項目によって1〜3件、生成AIは4〜24件です。誤りの向きが逆になっています。 いちばん差が出た客先連絡では、Jevが1件だったのに対し、生成AIは15〜24件ありました。

現場で困るのは落とすほうです。拾いすぎた行は人が読んで外せますが、落ちた行は人の目に触れません。

落とした理由と、直したときの代償

拾えたのは事故そのものが書かれた文で、落としたのは足場の傾きなど事故になりかけた状態でした。渡していた文を見直すと、客先連絡の判定基準を、安全の判定にも一緒に渡していました。安全とは関係のない文です。

当方の実測:日報100件を3つのAIに判定させると何が起きたか

この文を外し、質問文に「や衛生」を加え、「あり」とする境界(しきい値)も0.9から0.8へ下げて測り直すと、安全の見落としは6件から3件に減りました。

ただし、境界を0.9のまま文だけ外しても、拾えた数は4件のまま変わりませんでした(検算済み)。見落としが減った主な要因は、境界を0.8へ下げたことです。

ただし、同じ直しで緊急度が悪化しました。正解「今日中」25件のうち拾えた数が14件から4件に落ち、一致率も69件から46件に下がっています。

Haiku・Opusでも同じ向きに動きました(今日中を拾えた数:Haikuが6件から2件、Opusが20件から15件)。

注意:1つの直しが、狙った項目を良くし、別の項目を悪くすることがあります。 拾えた行・落とした行の実物、渡し方を直す前後の詳しい数字は実測データのページに載せました。

→ くわしくは「手書き日報をタブレット化|集計6日が1日に」で解説しています。

なぜ落ちたのか、原因はいくつあるか

100件の誤りを1件ずつ見ると、原因は3つに分かれました。モデルを替えて直るのは、そのうち1つだけです。

原因 打ち手
AIの読む力が足りない 「15時で打ち切り」を遅れと読めない 上位のモデルに替える
1行しか渡していない 「回答待ちのため、別の系統へ振り替えた」 前後の日もまとめて渡す
日報に書かれていない 「雨が強くなり、15時で打ち切り」 帳票の書き方を変える

3つめの原因が最も多く、ここはどのAIを使っても直りません。「雨で15時に打ち切り」と書かれていても、工期に響くかまでは書かれていないからです。

正解を付けた担当者も、この行には「予定に対して問題があるのかが不明」とメモを残し、迷った行として印を付けています(同じ迷いのメモが付いた行は11件あり、正解は「記録だけ」7件・「今日中」4件に分かれています)。人が読んで分からないことは、AIにも分かりません。

同じ行を、3つのAIは揃って「今日中」と答えました。正解は「記録だけ」です。分からないときに重いほうへ倒す動きですが、これが重なると人の読む量は減りません。

AIの判定は、人が見る行を決めるための補助です。安全の責任を肩代わりしません。試している間も、現場の安全確認と連絡の手順はこれまでどおり続けます。

答えが1つに決まることは、AIに聞かないほうが速い

1数えるのはプログラム
2言葉の意味を読むのはAI
3最後に決めるのは人

当方は以前、機種を流す順番を生成AIに直接聞いたことがあります。3回とも最適に届かず、1回あたり42円かかりました。同じ問題を0円のプログラムに解かせると、1秒かからずにAIより良い答えを出しています(多品種少量の段取り替え)。

数を数える、合計する、日付を比べる、毎日同じ時刻に動かす。こうした作業は、答えが1つに決まります。決まることをAIに聞くと、遅くて高く、しかも毎回答えが変わります。

判定だけのAIには、ワークフローの自動化・大量データの処理・即答が要る場面・生成AIの出力を見張る役割など、複数の使い道が公式に示されています。

当方が作ってきた仕組みでは、判定より読み取りの仕事のほうが多くありました(次の節で見ます)。最初からプログラムと分けておけば、埋めるべき隙間はそもそも狭くなります。

答えが1つに決まることは、AIに聞かないほうが速い

当方は「生成AIだけで組んだ仕組み」を作って比べたわけではありません。書けるのは、プログラムと分けた設計では出番が少なかった、というところまでです。

「読み取り」と「判定」は別物

当方がこれまで作ってきた仕組みを振り返ると、AIが受け持っている仕事は、ほとんどが読み取りでした。

当方が作ったもの AIの担当
工事写真の手書きメモ 読み取り(仕分けはプログラム)
図面の索引づくり 読み取り(検索はプログラム)
点呼記録の手書き欄 読み取り
ECレビューの9分類 判定

紙や画像から文字を取り出す仕事と、取り出した文の意味を判定する仕事は別です。判定だけのAIは文字しか受け取れません。 画像は渡せないため、読み取りの工程には入れません。

自社の作業を見直すときは、3つの項目を順に確かめると当てはまるかが分かります。

  1. 答えの候補を先に書き出せるか
    書き出せない仕事は対象外です。「良い案を出す」は候補が決まりません。
  2. プログラムの条件で決まらないか
    決まるならプログラムのほうが速く、安く、毎回同じ答えになります。
  3. 入力は文字になっているか
    紙や写真なら、先に文字にする工程が要ります。そこは別のAIの仕事です。

3つとも「はい」になって、初めて候補になります。

判定だけのAIをどう使うと良いか

当方の実測から言えるのは、AIが「あやしい」と言った確率の高い順に、人が先に読む使い方だけです。全部の行はそのまま残します。行を消さないので、AIが間違えても後から気づけます。

向かないのは、AIの答えで行そのものを捨てる使い方です。 次の2つは、よく挙げられますが当方は試していないので、確かめずに採らないでください。

  • 全部を上位のAIに通す前に振り分ける……Jevが「通さない」と誤って判定した行は、次のAIに届きません。
  • 「あり」の確率が低い行だけ人へ回す……確率が高いまま実は「なし」だった行(拾いすぎ)は、人にも届きません。

どちらも、取りこぼした行が通常の確認対象から外れる形です。採るなら、除いた行を人が抜き取りで確かめる経路を先に決めます。

判定だけのAIをどう使うと良いか

注意:渡し方を1つ直しても、別の判定にその代償が出ることがあります。 当方の実測でも、安全の見落としを減らした同じ直しで、急ぐ案件の見落としが増えました。

セキュリティ上の注意点

送り先の確認も要ります。このサービスは米国で動いています。公開されている方針では、入力を学習に使わず、サービス提供者以外の第三者には渡さないとしています。

保存日数は明記されていません。手元のパソコンで動かせる実装も公開されていますが、当方は試していないため、日本語で使えるかは分かりません。

自社の日報で試すなら、何から始めるか

最初にするのは、AIを選ぶことではありません。手元の備考を読んで、人でも判断できない文がどれだけあるかを数えることです。

  1. 備考を20枚読み、3つに分ける
    人へ回すもの、回さないもの、読んでも判断できないもの。3つめが多いなら、AIを入れる前に帳票を直します。
  2. 判断の決まりを文章にする
    何があれば連絡が要るのかを、担当者が5項目ほど書き出します。書けない決まりは、AIにも渡せません。
  3. 正解を先に付ける
    過去の備考100件に、現場を知る人が答えを付けます。AIの答えを見てから付けると、AIに合わせて正解が動きます。
  4. 同じ入力で複数のAIを比べる
    質問の文はどのAIにも同じものを渡します。言い方を変えると、モデルの差ではなく指示の差を測ってしまいます。
  5. 一致率ではなく、落とした数と拾いすぎた数を見る
    正解の「あり」が1割しかない仕事では、全部「なし」と答えるだけで9割当たります。一致率だけを見ると判断を誤ります。

社長が決めるのは、試す業務と、落としてよい範囲です。正解を付ける人と仕組みをつなぐ人を分けておくと、責任があいまいになりません。

この振り分けの仕組みそのものは、生成AIに書かせられます。次の文をそのまま渡すと、下書きが出てきます。

日報の数値欄はプログラムで集計し、備考だけを取り出して判定にかける仕組みを作ってください。全部の行を残し、確率の高い順に並べて表示してください。元の日報へ戻る目印を残し、答えと確率を原文と並べて表示してください。人へ回す境界は決め打ちにせず、境界未満の行も後から確認できる形にしてください。

列名や運用は会社ごとに違うため、そのまま完成する形にはなりません。実際の帳票に合わせて担当者が直します。

FAQ

判定だけのAIは、生成AIより正確ですか

正確とは言えません。当方の実測では、安全に関わる記述を生成AIが9件拾ったのに対し、Jevは4〜7件でした(渡し方で変わります)。選ぶ理由は正確さではなく、速さと費用にあります。

答えの形が決まっているなら、間違いは出ませんか

間違った判定は出ます。決まった形で返ることと、中身が正しいことは別です。当方の実測では、形の誤りは1件もありませんでした。一方で、100件中51件は、安全・遅れ・連絡・緊急度のどれかが人の答えと食い違っています。

人が読む日報は、どれだけ減りますか

当方の実測では、減らせると言える段階にありませんでした。落とした行を人が見つけられないためです。まず、読んでも判断できない備考がどれだけあるかを数えるところから始めます。

まとめ

  • 数える・合計する・毎日同じ時刻に動かす作業はプログラム、言葉の意味を読むのはAI、最後の決定は人に分ける。
  • 判定だけのAIは、渡す文1つで結果が大きく変わる。安全の見落としを6件から3件に減らした同じ直しで、急ぐ案件の見落としが11件から21件に増えた。
  • 誤りの原因は3つに分かれ、モデルを替えて直るのは1つだけ。残りは渡す情報を増やすか、帳票の書き方を変えるしかない。
  • 費用は判定だけのAIが上位の生成AIの130分の1で、速さは7倍。安さは公表のとおりだが、見落としと引き換えになる。
  • 一致率だけで比べると、急ぐ行を軽く見る癖と、重く見る癖の違いが見えない。

次の一歩手元の日報の備考を20枚読み、人へ回す記述と、読んでも判断できない記述を分ける。

自社の業務に合わせたAIツールの選定・導入は、ぜひ、ジッソウLABのゲンバAIへ無料でご相談ください。

大平

執筆・監修

大平 — ジッソウLAB代表

中小企業の業務改善・メルカリ物販、中古PC販売の実務経験を活かし、現場目線でAI活用を検証・発信

NEXT ACTION

この記事の内容が「自社でもいけるか」は、1分の無料診断で確かめられます。
個別の事情は無料相談でどうぞ(売り込みはしません)。

コメント

タイトルとURLをコピーしました