NOTES

9分で読めます

Jevを使ってみた感想|向く仕事・向かない仕事と、無人店舗で使う場所・使わない場所

ウェイトリストが通って TypeSafe の Jev を使った、完全無人セルフ写真館を運営する私の感想です。作文しないから事故の形が限られる、確率で返るから迷った件だけ人に回せる、という良さと、日本語の扱い・指示を字義どおりに読む癖・まだ新しいサービスであることの不安。LLM に分類させるのと何が違うか、私の店で使う場所と使わない場所を決めました。

この記事の要点

  • 向くのは「答えの選択肢を自分で書き出せる判断」。仕分け・優先度・採点・検証。向かないのは、生成・計算・日付の比較・理由の説明
  • 良かった点:作文しないので事故の形が限られる。確率と confidence が返るので、迷った件だけ人に回す線をコードで引ける。速くて安い
  • 気になった点:主言語は英語。指示を字義どおりに読むので、質問文の一語で答えが変わる。ウェイトリスト制の新しいサービスで、公式の数字は公式が測ったもの
  • 私の店では、公式LINEの仕分け・アンケートの自由記述・AIチャットの回答の検証に使う。解錠・返金・予約の確定のような取り返しのつかない判断には使わない

ウェイトリストが承認されて、TypeSafe の Jev をようやく使えるようになりました。第1回で仕組みと使いどころを整理し、第2回で私の店の文面を使って実際に比べました。その上での感想です。

作文しないので、事故の形が限られる

無人店で一番怖いのは、機械がそれらしい文章を返して、お客様が「伝わった」と思って待ってしまうことです。 Jev は文章を作れません。返るのは、こちらが決めた選択肢の確率だけ。 存在しない案内を作る、方針に無い約束をする、という事故が仕組み上起きない。 「気をつける」で防ぐのと、「できない」で防ぐのとでは、無人店ではかなり大きい差があります。

確率で返るので、迷った件だけ人に回せる

言葉のリストは、当たったか外れたかの2つしかありません。Jev は「困りごと0.70、写真0.30」のように、割れ方が見えます。 割れていれば confidence が下がるので、「0.9以上は自動、それ未満は人が見る」という線をコードで書けます。 40件のうち confidence が0.5を切ったのは1件だけで、外した2件はどちらも確率が2つに割れていました。外れるときは、外れそうな顔をして外れる。実務ではこれが一番ありがたい性質でした。

速くて安い

1件に質問3つで往復0.25秒、101件で約0.4円。LINEの返信の中で呼んでも、お客様が待つ長さにはなりません。 費用で使うかどうかを考える場面が来ないので、「とりあえず全部通してみる」ができます。

日本語は「扱えるが同等ではない」

公式ドキュメントに、主言語は英語で、CJK を含む他の言語は「扱えるが同等ではない」と書かれています。 私の40件では、日本語で指示しても英語で指示しても、答えは38件が同じで、正解の数もほぼ同じでした。 ただそれは7択の仕分けという易しい問題での話で、細かいニュアンスの採点や長い文面では差が出るかもしれません。自分のデータで確かめてから使う、が前提になります。

書かれた文字どおりに読む

AIの回答の検証で、「方針に書かれていない、または矛盾する事実を述べているか」と聞いたら、 正しいけれど方針の文面に載っていないだけの回答にも「はい」が0.82で付きました。 「書かれていない」を、字義どおり拾ったのです。公式が弱点の1番目に挙げている癖が、そのまま出ました。 LLM なら汲んでくれる曖昧さを、Jev は汲みません。質問は、契約書を書くつもりで書く必要があります。

「今その場で困っているか」を読み取りにくい

一番意外だったのがここです。「送り主は今、店内または店の前にいて、その場で詰まっているか」と聞くと、 「カメラのシャッターが押しても反応しないです。今撮影中です」が0.38、「エアコンが効いていなくて暑いです、今使っています」が0.26。 「今」と書いてあるのに、0.5に届きませんでした。その場の文面8件のうち、0.5で拾えたのは4件。 私が作った言葉のリストも4件で、ここは互角です。両方を並べて、どちらかが上げたら通知する形にすると6件になりました。

まだ新しいサービス

ウェイトリスト制で、モデルは1.13、レート制限は「混雑で変わる」と書かれています。 店の仕組みの中心に置くには、まだ様子を見たい段階です。 救いは、Jev に渡すものが「文面と、質問と選択肢」だけなこと。別の仕組みに乗り換えるときも、質問の設計はそのまま持っていけます。 囲い込まれる要素が少ない。

理由は返らない

「なぜ困りごとと判断したか」は分かりません。確率の割れ方から推し量るだけです。 お客様に理由を見せる必要がある場面や、あとで判断を説明する必要がある場面には向きません。

公式の数字は、TypeSafe 自身が作った評価で測ったものです。私の店の条件で測った数字と並べておきます。

項目公式の説明私の実測(2026年9月22日)
応答時間端から端まで70〜500ミリ秒福島から中央値251ミリ秒・最大633ミリ秒(質問3つ)
料金入力100万トークン $0.042・出力無料101リクエストで $0.0026
日本語扱えるが同等ではない7択の仕分けで、日本語の指示38件・英語の指示39件が正解(40件中)
型の誤り設計上ゼロ80件で、選択肢に無い答えや形の崩れは0件
確率の校正0.8と答えたものは約8割が正しい40件では件数が足りず確かめられない

最後の「校正」は、Jev の一番大事な売りですが、私の40件では確かめようがありません。 本当に0.8の答えの8割が正しいかは、数百件を正解つきで集めて初めて見えます。 仕組みに入れたあと、実際の文面で答え合わせを続けていくことになります。

公式の説明は TypeSafe 公式ブログ(2026年9月15日)と公式ドキュメント(2026年9月22日取得)。実測は第2回

向く向かない
文面の用件を決める(仕分け・振り分け)文章を書く・要約する・言い換える
緊急度・優先度を段階で付ける数を数える・計算する・金額を出す
感想や自由記述を採点・分類する日付や時刻を比べる(抜き出すのは可)
別のAIの出力が方針に反していないか検証する理由を説明する
候補を並べ替える・関係あるものを選ぶ何段もたどる推論・二重否定の入った条件
大量のテキストに同じ判断を安く速く当てる取り返しのつかない操作の可否を単独で決める

左の列に共通するのは、答えの選択肢を自分で書き出せることです。 「この文面は5つのどれか」「この感想は4段階のどこか」。選択肢を書き出せない判断は、Jev の型に入りません。 逆に、書き出せた瞬間に、その判断はコードで扱えるものになります。 今回いちばん頭を使ったのは、コードではなく「自分の店の判断を、選択肢に言い直す」作業でした。

同じことは LLM でもできます。「この文面を5つに分類して、JSONで返して」と頼めばいい。違いは、失敗の形です。

  • LLM:返事の形が崩れることがある(JSONが壊れる、6つ目の分類を作る、説明を付け足す)。 確率は頼まないと返らず、頼んでも作文された数字になる。1件に数秒かかることもある。
  • Jev:形は崩れない。確率は選択肢ごとの分布として返る。私の実測で0.25秒。 代わりに、理由は返らず、文脈の曖昧さを汲まない。

どちらが上という話ではなく、置く場所が違います。私の店では、お客様に見せる文章は人が用意したものだけを出す方針なので、 「どの文章を出すか」を決めるのは Jev の型で足り、文章そのものを LLM に作らせる必要がありません。 LLM は、HP の FAQ チャットのように「店の事実の範囲で答える」場所に残し、その回答を Jev で検証する。 2つを並べると、それぞれの弱いところを相手が押さえる形になります。

使う(この順に入れる)

1. 公式LINEの文面の仕分け。今の言葉のリストと並べて動かし、用件は confidence が高い件だけ Jev の答えを採る。 「その場で詰まっている」の通知は、言葉のリストと Jev のどちらかが上げたら上げる。
2. 撮影後アンケートの自由記述の採点と分類。溜まるだけだった文章を、集計できる列にする。
3. HP の AI チャットの回答の検証。「すぐ対応する」系の約束を、送る前に止める。質問は「矛盾する」に絞って書き直す。

使わない

解錠・返金・予約の確定の可否。取り返しのつかない操作を、確率だけで決めない。 料金の計算、日時の比較、お客様に見せる文章の生成。これらは今までどおりコードと人が持つ。

入れる順番を1から始めるのは、外れても害が無いからです。用件を外しても一般の案内に落ちるだけで、 「困っている人が誰にも届かない」方向には倒れません。 仕組みに新しいものを足すときは、外れたときに何が起きるかで順番を決めています。

  • 店や小さな事業の中に「人が目で見て仕分けている」作業があって、選択肢を書き出せる人
  • AI に文章を作らせるのが怖い、でも判断の材料は欲しい人
  • LLM の分類で返事の形が崩れるのに疲れた人
  • コードは AI のコーディング支援に書いてもらっていて、自分は「何を聞くか」を決める側にいる人(私がそうです)

逆に、文章を書かせたい人、理由を説明させたい人、英語以外の言語で精度の保証がほしい人には向きません。 ウェイトリスト制なので、申し込んでから使えるまでに時間がかかることも含めて。

この記事の調べ方

2026年9月22日に、私の店の文面40件・アンケート10件・回答8件で Jev(jev-1.13.0)を実際に叩いた結果と、 公式ブログ・公式ドキュメントの記載にもとづいています。検証のコードは AI のコーディング支援に書いてもらい、 質問の設計、正解づけ、結果の読み取り、この感想は私のものです。 TypeSafe 社とは関係がなく、紹介料も受け取っていません。

自分の業務の判断を「選択肢」に言い直すところから一緒に考えたい方は、LINEでのご相談も受け付けています。

PR

よくある質問

Jev を使ってみた感想は?

答えの形が決まっている判断を、速く安く確率つきで返してくれる道具として、よくできていると感じました。私の店の公式LINEの文面40件では、キーワード判定の25件に対して38件の用件を当て、1件0.25秒、費用は無視できる額でした。一方で、指示を書かれた文字どおりに読む癖があり、「今その場で困っているか」のような状況の読み取りは半分しか拾えませんでした。

TypeSafe Jev はおすすめですか?

「答えの選択肢を自分で書き出せる判断」をコードに組み込みたい人には、試す価値があります。仕分け・優先度・採点・AIの出力の検証などです。文章を作らせたい人、理由を説明させたい人、計算や日付の比較をさせたい人には向きません。

Jev と ChatGPT・Claude はどう使い分けますか?

文章を書く・要約する・理由を説明するなら LLM、「どれか」「はい/いいえ」「段階のどこか」を大量に速く安く決めたいなら Jev です。私の店では、お客様に見せる文章は人が用意したものだけを使い、どの文章を出すかを Jev に聞く形にします。LLM は HP の FAQ チャットのように店の事実の範囲で答える場所に残し、その回答を Jev で検証します。

Jev の弱点は何ですか?

公式が9つ挙げています。書かれた文字どおりに読む、計算と数が苦手、日付の比較が苦手、何段もたどる推論が苦手、関係ない文脈が多いと精度が落ちる、仕込まれた指示に引っ張られる、指示と選択肢が食い違うと混乱する、確率の整合性は保証しない、文章は生成できない。私の実験では「文字どおりに読む」がそのまま出ました。

Jev を使うのに機械学習の知識は要りますか?

要りません。質問と選択肢を日本語で書けば動きます。必要なのは、自分の業務の判断を「どれか」「はい/いいえ」「段階のどこか」に言い直す作業と、返ってきた確率のどこに線を引くかを自分のデータで決める作業です。後者は機械学習というより、業務の決めごとです。

ほかの記録


← 記録の一覧へ