NOTES

10分で読めます

Gemini 3.8 Liveの日本語と料金を実測|無人店舗で声のAIを使う場面、使わない場面

3言語48問で返事1.6秒・1回0.7円・作り話ゼロ。出来はよかった。それでも店内で会話させるものではない。声のAIを無人店のどこで使い、どこで使わないか。

この記事の要点

  • 日本語の案内だけを渡し、日本語・繁体字中国語・英語で48問。返事まで中央値1.62秒、1回約0.7円、作り話は0件
  • 「ドアが開かない」「スタッフを呼んで」には全問「今すぐ対応できない、公式LINEへ」。私の店の決めごとをAIは守った
  • それでも店内で会話させるものではない。「誰もいない」が価値の店に耳を置くことになり、返事が来ること自体が期待を生み、案内の言葉が毎回揺れる
  • 使うなら「作る段階」。生成AIで多言語の案内を作り、人が確かめ、店では毎回同じ音を流す。会話は、ボタンを押したときだけ・撮影時間の外で・聞き取りを画面で確かめてから
目次(8項目)
  1. 01結論:よくできている。それでも、店内で会話はさせない
  2. 02試した理由:案内は読まれない、そして台湾
  3. 03試し方:公開している案内だけを渡し、3言語で48問
  4. 04実測:返事まで1.6秒、1回0.7円、作り話ゼロ
  5. 05AIは私の店の決めごとを、全問で守った
  6. 06それでも店内に置かない3つの理由
  7. 07声のAIを使う場面、使わない場面
  8. 08試してみて分かったこと

Google が9月15日に出した、声で会話するAI「Gemini 3.8 Live」を、私の無人店の音声案内として試しました。 店の案内を日本語で渡し、日本語・繁体字中国語・英語で16問ずつ、計48問を声で聞いています。

先に結論を書きます。出来はよかった。それでも、無人店の店内で会話させるものではない、というのが私の見立てです。今回は試しただけで、店に入れる予定はありません。

返事は1.6秒で返り、1回0.7円。案内に無いことを作り話した答えはゼロで、「ドアが開かない」「スタッフを呼んで」には、 9問すべてで私の店の決めごとどおりに答えました。数字だけ見れば、置かない理由はありません。

それでも置かないのは、声のAIが店内にいること自体が、私の店が売っている「誰もいない」という価値を削るからです。 この記事は、その判断に至るまでの実測と、声のAIを無人店のどこで使い、どこで使わないかの整理です。

理由は二つあります。一つは、無人店では案内が読まれないことです。 当店に来る人の多くは無人店舗が初めてで、入口にも店内にも案内はあるのに、それでも読まれない場面が残ります(無人店舗の課題は機械より人)。開店から1年半で一番効いた改善は、文字以外の手段で伝えることでした。声で答える相手がいたら、その先に行けるのか。

もう一つは、この先のインバウンドです。当店は台湾からのお客様を見据えて、繁體字と英語に対応していく方針です。 今はまだ海外からの予約はほとんどありません。ただ、将来インバウンドの需要はありそうなので、先に実験的に試しておくことにしました。

無人店で多言語の案内をするとき、重いのは翻訳そのものより、言語ごとに案内を作り分けて、直すたびに全部を直す手間です。 日本語の案内を一つ渡すだけで、話しかけられた言語で答えてくれるなら、その手間が消えます。まずそこを確かめたかった。

AIに渡したのは、当店のホームページで公開している料金・使い方・アクセスの内容だけです。お客様の情報は一切使っていません。 あわせて、私の店の決めごとを四つ書きました。

  • 案内に無いことは、推測で答えない
  • スタッフが来る・すぐ対応する、とは言わない
  • 割引や例外を約束しない
  • 話しかけられた言語で、3文以内で答える
聞いた16問の内訳(それぞれ日本語・繁体字中国語・英語で聞いた)
種類問数見たかったこと
案内に書いてあること92人でいくら?/現金で払える?/どうやって入る?正しく答えるか
案内に書いていないこと3着替える場所は?/三脚は持ち込める?/Wi-Fiは?作り話をしないか
その場のトラブル3今お店の前でドアが開かない/スタッフを呼んで「すぐ行きます」と約束しないか
値引きの要求1学生なので安くして例外を約束しないか

質問の声は Mac の読み上げで作り、人が話すのと同じ速さでAIに流し込みました。1問ごとに新しい会話を開いて、前の答えを引きずらないようにしています。

読み上げの声は、実際のお客様の声より聞き取りやすい可能性があります。なまり・雑音・子どもの声では、結果が変わるかもしれません

日本語1.65秒繁体字中国語1.59秒英語1.63秒
話し終わってから最初の声が返るまで(中央値・各16問・2026年9月22日に福島から計測)
48問の結果(判定は私が1問ずつ書き起こしを読んで行った)
項目結果
話し終わってから声が返るまで中央値1.62秒。48問中47問が2.3秒以内。1問だけ17.4秒(原因は不明)
1回の案内の費用約0.005ドル(約0.7円)。案内文を毎回渡した分を含む
案内に書いてあること(27問)内容はほぼ全問正しい。英語の行き方に「タクシー」を足した(案内は「車で」だけ)
案内に書いていないこと(9問)8問で「この案内にはありません」。作り話は0件。1問は聞き違えて別の答え
その場のトラブル(9問)9問すべてで「今すぐの対応はできない、公式LINEへ」
値引きの要求(3問)3問とも約束しなかった

1.6秒は、店頭で人に話しかけて、少し考えてから返事が来るくらいの間です。言語で差が出なかったのは意外でした。 費用は48問で0.23ドル。1日に何十回使われても、月に数百円です。

料金は Gemini API の公式料金表(2026年9月22日閲覧):音声入力 100万トークンあたり3ドル、音声出力 12ドル、文字入力 0.75ドル。1ドル150円で換算

一番心配していたのは、AIが「すぐスタッフが参ります」と言ってしまうことでした。無人店でそれを言われたお客様は、来ない人を待つことになります。 9問のうち、そう言った答えは一つもありませんでした。「今お店の前にいるが、暗証番号を入れてもドアが開かない」への答えは、こうです。

日本語の答え(書き起こしのまま)

申し訳ございませんが、今すぐの対応はできません。暗証番号は、予約後に公式LINEから届くメッセージの2通目に記載されていますのでご確認ください。公式LINEのトークでお知らせください。

「暗証番号は2通目」は、案内にある事実を自分で結びつけて足した部分です。繁体字中国語でも同じ内容でした。 英語は「今すぐ対応できない、LINEへ」だけで、暗証番号の確認には触れませんでした。同じ案内から、言語によって親切さに差が出ます。

「三脚は持ち込めるか」「Wi-Fiはあるか」には、3言語とも「その情報はこの案内にはありません」と答えました。 もっともらしい答えを作ることは、48問を通して一度もありませんでした。

弱点も、はっきり出た

  • 聞き違えると、別の質問に正しそうに答える。「着替える場所はありますか?」を「hikari no basho(光の場所)」と聞き取り、 店の住所を答えました。作り話ではないのに、お客様には噛み合わない答えです。案内に無いことには「無い」と言えるのに、聞き違えたことには気づけない
  • 中国語の答えの2問が簡体字だった。当店は繁體字だけに対応する方針です。案内に「中国語は必ず繁體字で」と1行足して聞き直すと、16問すべて繁體字になりました
  • 店の言葉の訳がぶれる。「モニター割」が、1回目は「螢幕優惠(画面の割引)」、2回目は「評論優惠(口コミの割引)」。どちらも本来の意味から外れています

ここまで読むと、置けばいいように見えると思います。私もそう思いかけました。 それでも店内に置くものではないと考えるのは、AIの出来の問題ではなく、私の店が何を売っているかの問題だからです。

1. 「誰もいない」が、この店の価値だから

お客様の声で一番印象に残っているのは、「最初は写真館なので緊張していたが、自分たちしかいないので緊張が解けて、自然な笑顔で撮れた」でした。 撮影中の部屋にマイクを置いて、話しかければ答える相手がいる。それは、人の目の代わりに人の耳を置くことです。 無人にした意味が、そこで薄くなります。

2. 返事が来ること自体が、期待を生むから

当店は「今すぐ対応が必要な問い合わせは受け付けない」設計にしています(無人店舗が止まったらどうするか)。AIは全問でその決めごとを守りました。 けれど、困った瞬間に話しかけて声が返ってくれば、お客様は「対応してもらえる」と感じます。 答えの中身が「できません」でも、声がある、ということが先に期待を作ってしまう。無人店では、できないことは最初から無いほうがいい。

3. 案内の品質を、揃えたいから

生成AIは、同じ質問に毎回ちがう言い方で答えます。今回も「モニター割」の訳が毎回変わりました。私は、品質のばらつきは人の関与から生まれると考えていて、無人店はそのばらつきを仕組みで消すために作っています。

案内は、毎回同じ言葉で、同じ順番で流れるのが一番いい。揺らぐものを、揃えたい場所に入れることになります。

AIが悪いのではない

実測で分かったのは、Gemini 3.8 Live が「使えるかどうか」ではなく、「無人店のどこなら合うか」でした。 道具の出来と、置く場所の相性は、別の話です。

無人店の一日の流れに沿って、声のAIが合う場面と合わない場面を整理しました。私の店の結論で、業態が変われば線は動きます。

無人店で、声のAIをどこに置くか(当店の判断)
場面生成AIの声理由
予約前・来店前合わない自分から調べる場面。文字で読めるほうが早い
入口に着いてから入るまで合わない一番困る場面だが、今すぐの対応はできない。声があると期待だけが生まれる
入店した直後会話ではなく、決まった音必要なのは一度立ち止まってもらうこと。毎回同じ言葉が一番効く
撮影中置かないマイクが聞いている時点で「誰もいない」が消える
終わりと受け取り決まった音伝える内容は決まっている
海外のお客様への案内作る段階で使う生成AIで繁體字・英語の案内を作り、人が確かめ、店では決まった音として流す

一番筋がいいのは、生成AIは案内を「作る」段階で使い、店の中では毎回同じ音を流す形です。 多言語化の手間は減らせて、店内には揺らぎも、聞いている耳も持ち込みません。

会話がどうしても要るなら、お客様がボタンを押したときだけ、撮影時間の外で、聞き取った質問を画面に出して確かめてから答える。 そこまで絞れば、聞き違いの弱点も、期待を生む問題も、小さくできます。

今回は試してみただけで、私の店に入れる予定はありません。 分かったのは、声のAIの出来そのものより、無人店のどこに置くかのほうが大事だ、ということでした。 置くとしても店内で会話はさせない。多言語の案内に使うなら、生成AIで作って、人が確かめて、決まった音として流す。そこまでが、今回の実験から言えることです。

答えが出なかったことも一つあります。入口で本当に困っている人を、声を使わずにどう助けるか。 その先の答えは、まだ持っていません。無人店を回している方なら、それぞれの答えをお持ちだと思います。

この記事の調べ方

2026年9月22日の夜に、福島の自宅から gemini-3.8-live を使って測りました。質問は私が作った16問を3言語にしたもので、声は Mac の読み上げです。 答えの判定は、私が1問ずつ書き起こしを読んで行いました。Google 社とは関係がなく、紹介料も受け取っていません。

声のAIを店のどこに置くか、海外のお客様への案内をどう作るか。同じことを考えている方は、LINEでご相談ください。私の店で試した分は、隠さずお話しします。

PR

よくある質問

Gemini 3.8 Live は日本語で使えますか?

使えます。私は店の案内を日本語だけで渡し、日本語・繁体字中国語・英語で声で質問しましたが、48問すべてで質問と同じ言語で答えが返りました。ただし中国語の答え16問のうち2問が簡体字になりました。案内に「中国語は必ず繁體字で」と1行足すと、16問すべて繁體字になりました。

Gemini 3.8 Live の料金はいくらですか?

公式の料金表では、音声の入力が100万トークンあたり3ドル(1分あたり約0.005ドル)、音声の出力が100万トークンあたり12ドル(1分あたり約0.018ドル)、文字の入力が0.75ドルです。私の実験では、店の案内文を毎回渡して、1回の質問と答えで約0.005ドル(約0.7円)でした。

Gemini 3.8 Live の返事はどのくらい速いですか?

私が試した48問では、話し終わってから最初の声が返るまでの中央値が1.62秒でした。日本語1.65秒、中国語1.59秒、英語1.63秒で、言語による差はほとんどありません。48問中47問が2.3秒以内で、1問だけ17.4秒かかりました。

無人店舗にAIの音声案内を置くべきですか?

私の見立ては「店内で会話させるものではない」です。AIの出来が悪いからではありません。実測では作り話がゼロで、トラブルにも全問で私の店の方針どおりに答えました。それでも、撮影中の部屋で話を聞いている相手がいることは「自分たちしかいない」という当店の価値を削り、返事が来ること自体が「対応してもらえる」という期待を生みます。使うなら、多言語の案内を作る段階で使い、店内では毎回同じ音を流す形が合うと考えています。

AIの音声案内はインバウンド対応に使えますか?

日本語の案内を1つ渡すだけで、繁体字中国語と英語で正しく答えたので、言語ごとに案内を作り分ける手間は減らせます。ただし店独自の言葉(当店では「モニター割」)の訳が毎回ぶれるので、訳し方の対応表が要ります。使うなら、生成AIは案内を作る段階で使い、店内には人が確かめた決まった音声だけを置く形が合うと考えています(私の店では試しただけで、入れる予定はありません)。

ほかの記録


← 記録の一覧へ
Gemini 3.8 Liveの日本語と料金を実測|無人店舗で声のAIを使う場面、使わない場面|無人店舗ラボ