NOTES

15分で読めます

Jevの日本語精度を実測|LINEの問い合わせ40件でキーワード判定25件→38件、1件0.25秒

Jev は日本語で使えるのか。完全無人のセルフ写真館の公式LINEに届く文面40件で、今のキーワード判定と Jev を比べました。用件の正解は25件→38件(日本語で指示)・39件(英語で指示)、応答は日本から中央値251ms、80件で約0.3円。外した2件、しきい値で結果が変わるはい/いいえの質問、アンケート採点とAI回答の検証まで、全部の数字を出します。

この記事の要点

  • 公式LINEに届く想定の文面40件で、用件(7択)の正解はキーワード判定25件、Jev(日本語で指示)38件、Jev(英語で指示)39件
  • 日本語で指示しても英語で指示しても、答えは40件中38件が同じ。違いはトークン数で、日本語の指示は約2割多い
  • 応答は福島から中央値251ms・90%が321ms以内・最大633ms。101リクエストで $0.0026(約0.4円)
  • 外した2件は、どちらも確率が2つに割れて confidence が下がっていた。外れそうな件だけ人に回す設計がコードで書ける
  • 「その場で詰まっているか」は、キーワード判定も Jev も8件中4件しか拾えなかった。2つを並べてどちらかが上げたら上げる形にすると6件、誤報0件
  • はい/いいえの質問は、しきい値で結果が変わる。「人が要るか」は0.5だと拾いすぎ、0.75で37件中36件。質問ごとに線を引く

第1回で、Jev の仕組みと、私の店の開発で置ける場所を6つ挙げました。 今回は一番効きそうな「公式LINEに届く文面の仕分け」を、実際に比べます。 公式は、主言語は英語で日本語は「扱えるが同等ではない」と書いているので、日本語でどこまで使えるのかがこの回のいちばんの問いです。

用意したのは、公式LINEに届く想定の文面40件です。実際の会話のログではなく、 届く文面の型(鍵が開かない、予約を変えたい、写真が来ない、駐車場はあるか、取材の相談、お礼だけ……)を、 個人情報が入らない形で書き起こしました。正解は私が付け、「領収書は発行できますか」のように 料金の質問とも予約の質問とも取れるものは、両方を正解にしています。

それぞれの文面に、3つの質問を1回のリクエストで聞きました。実際に渡した質問はこれです。

Jev に渡した質問(日本語版)
"topic": Choice(
  instructions="このメッセージの主な用件はどれか。無人のセルフ写真館の公式LINEに届いた文面。",
  criteria={
    "trouble":  "今その場で困っている。鍵・入店・機器・撮影・画面が動かない・エラー",
    "photos":   "撮影した写真データの受け取り・ダウンロード・保存期間",
    "reserve":  "予約の確認・変更・キャンセル・空き状況・支払い・延長・クーポン",
    "access":   "店の場所・行き方・駐車場・住所",
    "faq":      "料金・プラン・持ち物・服装・ペット・人数など一般的な質問",
    "business": "取材・掲載・営業・法人からの提案など、お客様ではない相手",
    "general":  "お礼・相槌・感想・上のどれにも当てはまらない",
  },
),
"onsite": Noul(instructions="送り主は今、店内または店の前にいて、その場で詰まっているか。"),
"human":  Noul(instructions="自動案内では終わらず、人による対応(返金・電話・手続きの失敗の解決)が必要か。"),

比べる相手は、いま私の店の仕組みで使っている「言葉のリスト」です。文面に「鍵」「開かない」があれば困りごと、 「予約」「キャンセル」があれば予約、というふうに決めるもので、本番と同じ関数に40件を通しました。 Jev には、上の質問をそのまま使った日本語の指示と、同じ中身を英語に書き直した英語の指示の2通りを走らせています。 文面(state)はどちらも日本語のままです。

棒グラフ。40件中の正解数が、キーワード表25件、Jev日本語指示38件、Jev英語指示39件
用件の正解数。言葉のリストは半分強、Jev は日本語で指示しても英語で指示しても9割台
言葉のリスト(今の判定)Jev(日本語で指示)Jev(英語で指示)
用件の正解(40件)253839
その場で詰まっているか(37件)333332
人が要るか・しきい値0.5(37件)353031
人が要るか・しきい値0.75(37件)3636

2026年9月22日・私の店の実測。「その場で詰まっているか」「人が要るか」は、正解がはっきりしている文面だけを数えている(37件)。 言葉のリストの2つは、今の仕組みの緊急度の判定を当てはめたもの

用件は、言葉のリストの25件に対して Jev は38件・39件でした。 言葉のリストが外した15件のほとんどは、当たる言葉が入っていなくて「その他」に落ちたものです。 「福島駅からどうやって行けばいいですか」には「行き方」も「場所」も入っていない。 「雨の日でも営業していますか」には「料金」も「持ち物」も入っていない。意味では明らかなのに、文字では拾えない文面です。

言葉のリストの名誉のために書いておくと、あれは「外れても害が無い」ように作ってあります。 当たらなければ一般の案内に落ちるだけで、どの案内にも「このままメッセージを送れば順に確認します」が付く。 ただ、「その場で詰まっている」文面8件のうち、言葉のリストが拾えたのは4件でした。 そしてここは、Jev も同じ4件でした。これは後の「はい/いいえ」の節で詳しく書きます。

先に Jev を試した方の解説記事には、「指示は英語、データは日本語にすることも検討を」という提案がありました。 公式が英語を主言語としている以上、自然な発想です。私の40件ではこうなりました。

日本語で指示英語で指示
用件の正解(40件)3839
日本語版と英語版で答えが同じだった件数38 / 40(共通)
confidence の中央値1.001.00
confidence が0.5未満の件数11
1件の入力トークン(平均)678548

差は1件だけで、その1件(後で書く「さっき撮った写真が一枚も表示されないです」)は人が読んでも迷う文面でした。 違いが出たのはトークン数で、日本語の指示は英語より約2割多い。ただ、1件0.004円前後の世界なので、費用の差は気にするほどではありません。

私の結論

7択くらいの仕分けなら、指示は日本語で書いて問題ありませんでした。 日本語で書けば、選択肢の説明を店の言葉のまま直せる。これは運用上かなり大きい利点です。 ただし、細かいニュアンスの採点や長い文面では差が出るかもしれないので、用途が変わるたびに自分のデータで測り直します。

Jev(日本語で指示)が外した2件は、どちらも人が読んでも迷う文面でした。

文面私の正解Jev の答え確率の内訳
モニター割のインスタ投稿ってどうやればいいですか料金など一般的な質問取材・営業・法人取材・営業 0.70 / 一般的な質問 0.25
さっき撮った写真が一枚も表示されないです写真の受け取り困りごと困りごと 0.70 / 写真の受け取り 0.30
横棒グラフ。「さっき撮った写真が一枚も表示されないです」に対する7つの選択肢の確率。trouble 0.70、photos 0.30、他は0
外した1件の中身。答えは1つに決まらず、2つの選択肢に割れている。confidence は0.65

1件目は「モニター割」という私の店だけの言葉を Jev が知らないので、「インスタ投稿」から SNS の営業と読んだのだと思います。 選択肢の説明に「モニター割・SNS割の投稿の仕方」と書き足せば直る種類の外れです。 2件目は、私自身「困りごと」でもいいと思っています。英語で指示した版は「写真の受け取り」0.68 と逆に割れました。

どちらも確率が2つに割れていて、confidence が下がっています。外れるときは、外れそうな顔をして外れる。言葉のリストは当たりか外れかの2つしかないので、 外れたことに気づけません。ここが一番の違いでした。

言葉のリストが外した15件(抜粋)

  • 「福島駅からどうやって行けばいいですか」→ その他(正解:場所)
  • 「雨の日でも営業していますか」→ その他(正解:一般的な質問)
  • 「急いでいます、入店できません」→ その他(正解:困りごと)
  • 「ドアが開いたけど中が真っ暗です」→ その他(正解:困りごと)
  • 「エアコンが効いていなくて暑いです、今使っています」→ その他(正解:困りごと)
  • 「取材のご相談で連絡しました」→ その他(正解:取材。リストにこの区分が無い)
  • 「リモコンってどうやって使うんですか?来週行く予定です」→ その他(正解:一般的な質問)

言葉のリストを育てれば拾えるものもあります。ただ、活用形(できない/できません)や言い換え(行き方/どうやって行けば)を 1つずつ足していく作業は終わりがなく、足すほど関係ない文面にも当たるようになります。意味で読むほうが、この作業そのものをなくせます。

「その場で詰まっているか」は、どちらも半分しか拾えなかった

正解数だけ見ると、言葉のリストも Jev も33件で同じです。ただ中身を分けると、「その場で詰まっている」文面8件のうち拾えたのは、 どちらも4件でした。落としたものは、たとえばこうです。

文面Jev の「その場」の確率
カメラのシャッターが押しても反応しないです。今撮影中です0.38
さっき撮った写真が一枚も表示されないです0.34
エアコンが効いていなくて暑いです、今使っています0.26
ドアが開いたけど中が真っ暗です0.48

「今撮影中です」「今使っています」と書いてあっても、0.5に届いていません。 質問を「店内または店の前にいて、その場で詰まっているか」としたので、「詰まっている」の度合いまで一緒に測られているのだと思います。 しきい値を下げると拾える数は増えますが、関係ない文面も上がってきます。

「その場で詰まっているか」のしきい値(日本語で指示・その場の文面8件、それ以外28件)
しきい値拾えた関係ない文面を上げた
0.54 / 80 / 28
0.45 / 81 / 28
0.37 / 87 / 28

ここで効いたのが、言葉のリストと Jev を並べて、どちらかが上げたら上げる形です。 2つが拾った4件ずつは、重なっているのが2件だけで、残りはそれぞれ別の文面でした。合わせると8件中6件、関係ない文面を上げたのは0件です。 見落としたくない通知は、どちらか片方に任せるより、並べたほうが強い。私の店で入れるならこの形です。

「人が要るか」は、0.5では拾いすぎた

もう1つの「人が要るか」は逆でした。0.5を境に「はい」とすると Jev は30件で、言葉のリストの35件より悪い。

中身を見ると、「鍵が開きません。店の前にいます」(0.70)、「店に着いたのですが、解錠ボタンを押しても開きません」(0.73)のような、その場で詰まっている文面に「人が要る」も0.5〜0.7で付いていました。 質問には「返金・電話・手続きの失敗」と例を書いたのですが、「困っている人には人が要る」と読まれた形です。間違いとも言い切れません。

しきい値を0.75に上げると36件になり、言葉のリストを超えます。 返金の相談は0.89、電話の依頼は0.79、「予約したのにマイページに出てきません」は0.61。 この用途では0.75が境として合っていました。

「人が要るか」のしきい値と正解数(37件)
しきい値0.50.60.70.750.8
日本語で指示3033343635
英語で指示3133343636
しきい値は質問ごとに決める

公式ドキュメントも「しきい値を質問の型をまたいで使い回さない」と注意しています。 はい/いいえの確率は、質問の書き方で重さが変わります。 同じ0.6でも、「その場で詰まっているか」の0.6と「人が要るか」の0.6は意味が違う。 自分の文面で分布を見て、質問ごとに線を引くのが実務の手順になります。

ヒストグラム。80リクエストの往復時間の分布。200〜330msに集中し、中央値は252ms
往復時間。福島の自宅回線から Python SDK で1件ずつ順に送った80リクエスト。最大でも633ms
項目日本語で指示英語で指示
往復の中央値251ms254ms
90%がこれ以内321ms310ms
最大633ms609ms
入力トークン(1件平均)678548
40件の合計トークン27,11021,910
40件の費用($0.042/100万トークン)$0.00114$0.00092
TypeSafe コンソールの Usage 画面。直近24時間の Spend $0.0026、Tokens 71,735、Requests 101
コンソールの利用状況。この記事の実験80件に、アンケート・回答検証・プレイグラウンドの分を足した101リクエストで $0.0026(約0.4円)

3つの質問を1回に載せて0.25秒。日本からでも、公式の「70〜500ミリ秒」の範囲にほぼ収まりました。 LINEの返信の中で使っても、お客様が待つ長さにはなりません。 費用で使うかどうかを決める場面は、私の店の規模では来ません。

撮影後アンケートの自由記述(10件)

「満足度は4段階のどこか(Score)」「主に触れているのは何か(Choice)」「店側が直せる改善点が入っているか(Noul)」を聞きました。

自由記述満足度(0〜3)触れているもの改善点あり
照明がきれいで写真が盛れました。また行きます2.92写真の仕上がり0.08
駐車場が分かりづらい。看板がほしい0.00場所・看板0.93
料金が安くて助かる。ただ50分はあっという間1.68料金・時間0.44
スタッフがいないのでポーズの相談ができなかったのが少し残念0.67案内(0.48)0.68
普通でした1.02その他0.06
子どもが飽きてしまい、40分で出ました。子ども向けの小物があると嬉しい0.05設備・小物0.82

「ただ50分はあっという間」を1.68(どちらとも言えない寄り)、「少し残念」を0.67と、 褒めながら不満を混ぜた文面の温度が数字に出ています。溜まるだけだった自由記述が、集計できる列になります。 迷ったのは「スタッフがいないので〜」で、触れているものの confidence が0.48。 「案内」と「スタッフがいないこと自体」の2択に割れました。これは選択肢の切り方の問題で、私の側で直すところです。

サポートAIの回答の検証(8件)

店の方針(完全無人・その場で返事はできない・電話番号は公開していない)を state に入れ、 AIチャットが返しそうな回答8件に、「担当者がすぐ対応すると約束しているか」 「方針に書かれていない、または矛盾する事実を述べているか」「そのまま送ってよいか(送る/人が確認/止める)」を聞きました。

回答すぐ対応の約束方針と矛盾判定
すぐにスタッフが店舗へ向かいますので、少々お待ちください0.900.96止める(0.99)
担当者が5分以内に折り返しご連絡します0.850.94止める(0.96)
お電話でも受け付けております。0120-xxx-xxxまで0.160.97止める(0.99)
営業時間は10:30から19:30です0.020.03送る(0.97)
写真は撮影から半年間ダウンロードできます0.020.87人が確認(0.70)
予約の変更はマイページからご自身で行えます。当日でも空きがあれば変更できます0.040.82人が確認(0.29)

無人店で一番まずい「すぐ向かいます」「5分以内に折り返します」は、はっきり止まりました。 一方で、「当日でも空きがあれば変更できます」のように正しいけれど方針の文面に載っていないだけの回答にも、 「矛盾」が0.82と高く付きました。質問を「書かれていない、または矛盾する」としたので、「書かれていない」を字義どおり拾ったのです。 公式が弱点の1番目に挙げている「書かれた文字どおりに読む」が、そのまま出ました。 直すなら「矛盾する」だけに絞るか、方針の state にもっと事実を載せるか。質問文の一語で結果が変わります。

第3回は、使ってみた感想です。向く仕事と向かない仕事、私の店で使う場所と使わない場所を書きます。

この記事の調べ方

文面40件・アンケート10件・回答8件は、すべて私が用意したもので、実際のお客様の文面ではありません。 Jev は jev-latest(jev-1.13.0)、Python SDK 0.7.1 を使い、2026年9月22日に福島の自宅回線から実行しました。 言葉のリストによる判定は、私の店の仕組みで実際に動いている関数に同じ文面を通したものです。 検証のコードは AI のコーディング支援に書いてもらい、質問の設計、正解づけ、結果の読み取りは私がやりました。 TypeSafe 社とは関係がなく、紹介料も受け取っていません。

自分の店の文面で同じ比較をしてみたい方は、LINEでのご相談も受け付けています。

PR

よくある質問

Jev は日本語でどのくらい正確ですか?

私の店の実測では、無人セルフ写真館の公式LINEに届く想定の日本語の文面40件で、用件(7択)の正解が、日本語で指示して38件、英語で指示して39件でした。比較した言葉のリスト(キーワード判定)は25件です。文面も正解も私の店のものなので、他の用途では自分のデータで確かめる必要があります。

Jev への指示は英語で書いたほうがいいですか?

私の40件では、ほとんど差がありませんでした。文面は日本語のまま、指示と選択肢の説明だけを日本語にした場合と英語にした場合で、答えは40件中38件が同じ、正解は38件と39件です。英語の指示のほうがトークンは約2割少なくなりますが、費用はどちらも無視できる額でした。日本語で書いて、自分のデータで確かめてから英語に変える必要があるか判断すれば十分だと思います。

Jev の応答速度はどのくらいですか?

福島の自宅回線から Python SDK で、1件の文面に質問3つを同時に載せて、往復の中央値が251ミリ秒、90%が321ミリ秒以内、最大633ミリ秒でした(2026年9月22日、80リクエスト)。公式は70〜500ミリ秒としています。

Jev の費用は実際いくらかかりましたか?

この記事の実験80件に、アンケートの採点・回答の検証・プレイグラウンドの試行を足した101リクエストで、コンソールの表示は $0.0026(約0.4円)でした。1件の文面に質問3つで、入力は平均550〜680トークン。出力トークンは無料です。

ほかの記録


← 記録の一覧へ