お客さまから届いたLINEやメールを、誰が読んで、誰に回すかを決めていますか?
「これは予約の話」「これはクレームだから店長へ」。1通ずつは数秒でも、毎日積み重なるとそれなりの時間になりますよね。
2026年9月、この「振り分けの判断」だけを専門にするAIが公開されて話題になりました。文章は一切書かず、判定だけを返すAIです。名前を Jev(ジェヴ)といいます。
「いま使っているAIの手前に置けば、安く速くなるのでは」と思い、実際に試してみました。先に結論をお伝えします。
- 日本語の問い合わせ30件で測ったところ、用件の分類は30件すべて正解でした
- ただ、安さは思ったほど効きません。月1万件さばいても、差額は月1,400円ほどでした
- 本当に役に立つと感じたのは「自信がないときに、自信がないと数字で言ってくれる」点でした
以下、やったことを順番に書きます。
きっかけは「7秒で航空券を検索するAI」
X(旧Twitter)で、AIがブラウザを操作して航空券の検索を7.1秒で終える動画が流れてきました。ふだん使っているAIのブラウザ操作は、1つ進むたびに数秒待ちます。それに比べると相当な速さです。
仕組みを調べると、速さの理由は「AIに文章を書かせていない」ことでした。画面のボタンに番号を振り、「次は何番を押すか」だけを選ばせています。その「選ぶだけ」を担当しているのが Jev でした。
覚える言葉は3つだけです
判定だけするAI
ふつうのAIは質問に文章で答えます。Jev は文章を書きません。こちらが用意した選択肢から1つ選ぶか、「はい」である確率を 0〜1 の数字で返すだけです。選択式のテストだけを解くAI、と考えると近いです。
確信度
選んだ答えに、どのくらい自信があるかを示す数字です。1.0 なら迷いなし、0.5 なら「正直わかりません」という意味です。
人に回す線
「確信度がこの数字より低ければ、自動で処理せず人に回す」という線引きです。この線を決めるのは、AIではなく私たち人間です。

まず、安全に試せる場所を作りました
話題になった道具は、すぐ本番のパソコンで動かしたくなります。ここで一度立ち止まりました。
配布されているプログラムの中身を読むと、初期設定のままでは、私がふだん使っているブラウザにそのままつながる作りでした。ふだんのブラウザは、会計ソフトにもネットショップの管理画面にもログインしたままです。そこをAIが操作できる状態にするのは避けたいところです。
そこで、試験専用のブラウザを別に立ち上げ、AIがつながる先をそちらだけに固定しました。あわせて、利用状況を開発元へ自動送信する機能が入っていたので、それも止めています。
新しいAIの道具を試すときは、「どこにつながるのか」「何を外へ送るのか」を先に確かめる。地味ですが、これだけで事故の大半は防げます。
「手前に置けば安くなる」は本当か、自社の仕組みを棚卸ししました
次に考えたのが、冒頭の思いつきです。いま使っているAIの手前に Jev を置き、簡単な判定はそこで済ませる。文章が必要なときだけ、ふつうのAIを呼ぶ。こうすれば安く速くなりそうです。
ところが、自社とお客さまの仕組みを全部調べてみると、Jev を置ける場所が1か所もありませんでした。
- 毎朝の自動レポートなどは、月額固定のプランで動いています。呼ぶ回数を減らしても、料金は変わりません
- 使った分だけ料金がかかる仕組みは1つだけありました。手書きの表を写真から読み取る処理です。ところが Jev は文字しか読めず、写真は扱えません
「判定AIを足して得をするのは、あとに控えているAIの出番をまるごと減らせるときだけ」。調べてみて腹落ちしたのはこの点です。判定したあとに結局毎回ふつうのAIを呼ぶなら、手間が1回増えるだけで、むしろ損になります。
日本語で30件、実際に測ってみました
いまは置き場所がなくても、今後お客さまのLINEに自動応答を組むときには使えるかもしれません。気がかりは日本語でした。開発元の説明書に、英語がいちばん得意で、日本語などは扱えるものの同じ精度ではない、自分のデータで試してから使ってほしい、という趣旨のことがはっきり書いてあるからです。
そこで、整体院のLINEに届きそうなメッセージを30件用意しました。うち10件は、わざと判断しにくい文面にしています。
- 「今から行けますか?」(短すぎて手がかりが少ない)
- 「まあ、別にいいんですけどね。次からはちゃんとしてもらえれば。」(遠回しな不満)
- 「妊娠中でも受けられますか?」(料金の質問に見えて、人が答えるべき内容)
- 「施術中に首をひねられてから手がしびれています」(すぐ人が対応すべき内容)
それぞれに4つの質問をしました。用件は6種類のうちどれか。不満が含まれているか。今日中の対応が必要か。自動返信ではなく人が返信すべきか。
比較のために、同じ30件を、文章も書けるふつうのAIのうち小型で安いもの(Claude Haiku 4.5)にも判定させました。

| 用件の分類 | 不満の有無 | 今日中の対応 | 人が返信すべきか | 返事までの時間(中央値) | |
|---|---|---|---|---|---|
| Jev | 30/30 | 26/26 | 27/27 | 28/29(見逃し0) | 0.59秒 |
| ふつうのAI(小型) | 30/30 | 26/26 | 26/27 | 27/29(見逃し0) | 0.76秒 |
※人が読んでも意見が割れる項目は、採点から外しています。
日本語でも、用件の分類は30件すべて正解でした。外した1件は、子どもの発熱で当日キャンセルしたいという連絡を「人が返信したほうがよい」と判定したものです。回しすぎる方向の外れなので、実害はありません。人に回すべきものを見逃した件数は、どちらのAIも0件でした。
測ってみて分かった5つのこと
1. 「自信がない」と言えるのが、いちばんの価値でした
30件のうち29件は、確信度 0.7 以上で答えていました。0.7 を下回ったのは1件だけです。
「昨日予約のメッセージ送ったんですけど、返事がまだ来てないです。今日の夕方希望なんですが」
これは予約の依頼でもあり、返事が遅いことへの不満でもあります。人が読んでも迷う文面で、AIもきちんと迷っていました(確信度 0.6)。迷ったものだけを人に回せば、残りの29件は安心して自動処理に任せられます。

2. 質問は日本語のままのほうがよい結果でした
英語が得意なAIなら、質問文だけ英語にすれば精度が上がるのでは、と考えて試しました。結果は逆でした。「まあ、別にいいんですけどね」という遠回しな不満に対して、「人が返信すべき」確率が 0.75 から 0.49 に下がり、見逃しが1件出ています。日本語の含みを読むには、質問も日本語のままがよさそうです。
3. 「はい/いいえ」の数字は、真ん中あたりに寄ることがあります
「いつもありがとうございます!おかげで肩がだいぶ楽になりました」というお礼に対して、「人が返信すべき」確率が 0.47 と出ました。半々に近い数字です。0.5 で機械的に線を引くと、こうした際どいものがどちらに転ぶか読めません。クレームの見逃しが困る場面では、線を 0.3 あたりまで下げて、多めに人へ回すのが安全だと感じました。
4. 速さは宣伝ほどではありませんでした
開発元のサイトには「0.1秒台で完了」という例が載っています。日本から使うと、実測は 0.59秒でした。ふつうのAI(小型)との差は 0.2秒弱です。ただし、いちばん遅かったときの時間は Jev が 0.8秒、ふつうのAIが 1.9秒で、安定感には差がありました。
5. 安さは、件数が多くないと効きません
1件あたりの料金を実測から計算すると、Jev が約0.006円、ふつうのAI(小型)が約0.14円でした(1ドル150円で換算)。20倍以上の差です。
ところが月1万件に直すと、約60円と約1,400円。差額は月1,400円足らずです。1日に30件ほどの問い合わせなら、差は月に100円ちょっとです。「AIの費用が安くなります」は、中小規模のお店や会社では導入の理由になりにくい、というのが正直な感想です。
つまずきやすいところ早見表
| 起きること | 理由 | どうするか |
|---|---|---|
| 思ったより速くない | 開発元は米国の会社で、日本からは通信の往復に時間がかかるとみられる | 「0.1秒」を前提に設計しない。実測してから決める |
| 際どい数字(0.4〜0.6)が出る | 「はい/いいえ」の質問には確信度が付かず、確率だけが返る | 見逃すと困る判定は、人に回す線を低めに引く |
| 遠回しな不満を見逃す | 質問文を英語にすると、日本語の含みを読みにくくなる | 質問文は日本語で書く |
| 金額や日付の判断を間違える | 計算や日付の前後比較は苦手だと、開発元が明記している | 計算は従来のプログラムに任せ、AIには読み取りだけ頼む |
| 悪意のある文面で判定がぶれる | わざと誘導する文章に弱いと、開発元が明記している | 不正対策の関門には使わない |
ご自分の会社で確かめるなら
AIを入れる前に、紙とペンでできることがあります。
- 「誰が、何を見て、何を判断しているか」を10個書き出してみてください。問い合わせの振り分け、申請書の不備チェック、通知の要不要などです
- その中から、判断の基準を言葉にできるものを選びます。「返金という言葉があれば経理へ」のように説明できるものです
- 過去のメッセージを30件ほど集め、人の判断を正解として並べます。個人情報は消しておきます
- AIに同じ30件を判定させて、人の判断と何件合うかを数えます
見るところは正解率だけではありません。「人に回すべきものを見逃した件数」と「確信度が高いものだけに絞ったとき、何件を自動に任せられるか」の2つです。今回の実測も、この2つで評価しました。
正直に書いておくこと
- 今回の30件は、私たちが用意した文面です。実際のお客さまのメッセージには、誤字や絵文字、前後の文脈があります。本番で使う前には、実際のメッセージで測り直す必要があります
- 30件は少ない数です。「日本語でも使えそう」とは言えますが、「日本語でも英語と同じ精度」とまでは言えません
- Jev は公開されたばかりで、利用回数の上限が予告なく変わると開発元が明記しています。止まったときに、ふつうのAIか人に切り替える道を用意しておく必要があります
- 判定させる文面は、海外の開発元のサーバーへ送られます。学習には使わないと明記されていますが、お客さまの文面を扱うなら、事前に一言お伝えしておくのが筋だと考えています
- 自社の仕組みには、いまのところ Jev を置く場所がありませんでした。今回は「今後のお客さま向けの選択肢として、使える水準かどうかを確かめた」という位置づけです
要点3行
- 判定だけするAIは、日本語の問い合わせ30件で用件の分類を全問正解しました。人に回すべきものの見逃しも0件でした
- 安さは月1万件でも差額1,400円ほどです。価値は「自信がないときに数字でそう言ってくれる」ことにあります
- 導入の前に、毎日の「判断」を10個書き出し、過去の30件で人の判断と比べてみるのがおすすめです