最高性能AIに1日任せるはずが、100点満点のゴミで止まった
「100点満点のゴミ」。自分で言って笑ってしまったが、出てきたものを見た時の感想としてはかなり正確だった。
高性能のAIに、調査から収益化の導線づくりまで一日で任せる。利用枠も余っている。人が途中で細かく指示せず、どこまで自走するかを見てみたい。そんな贅沢な実験を始めた。ところがAIの監査は96点、ついには100点。それなのに、買う人が迷わず使える商品には見えなかった。点数が高いほど、こちらのため息が深くなる。何を採点しているのか、そっちから聞きたくなる実験だった。

利用枠を使い切りたくて始めた実験
きっかけは、AIの利用枠が大きく余っていたことだ。どうせなら最高クラスのモデルをフルに使い、市場調査、ペルソナ設定、商品づくり、販売導線まで任せてみようと思った。最初は海外向けのデジタル商品や電子書籍など、いくつも案が浮かんだ。だが、個別の案を細かく指定してしまえば、いつもの「人が監督してAIが作業する」形になる。
今回はそこを外した。AIが自分で材料を集め、方向を選び、ゴールまでつなげられるのかを見たかった。売上が確実に出るとは思っていない。むしろ失敗しても、どこで止まるか分かれば収穫だ。優秀な相手に仕事を渡す前、その人の得意と苦手を知るための試運転に近い。時間と利用枠を使う価値は、完成品だけでなく限界線にもあると考えた。
最初の一本で、もう人間が止めた
実験は早々に止まった。最初の一本が上がってきたところで監査を入れ、内容を見た瞬間に「これは出せない」と判断した。情報量はある。ファイルも整っているらしい。だが、初めて見る人が何をすればいいのか分かりにくい。作った側だけが操作を理解している商品の典型に見えた。
この時点で笑えるのは、AIが手を抜いたわけではなさそうなことだ。細かく作り込み、確認項目を増やし、いかにも真面目に仕上げている。それでも価値は高くならない。仕事で怖いのは、雑な失敗より、丁寧に作られた的外れな成果物だ。見た目が整っているので、急いでいる時ほどそのまま通したくなる。そこで一度、人が触って止められたのは大きかった。
「参照知識を入れ忘れた」は言い訳か、仮説か
途中で、自分が普段使うエージェント向けのテンプレートや、マーケティング用に蓄えた知識を十分に渡していなかったことに気づいた。普通のチャットから走らせたのだから、判断の前提が足りない。これは失敗の理由としてあり得る。ただし、「だから次は必ず成功する」とは言えない。
そこで考えたのは、同じ依頼を参照知識あり・なしで比べることだった。優秀な新入社員でも、会社の顧客、商品、禁止事項、過去の失敗を知らずに重い案件を渡されたら困る。AIも同じだ、という感覚は強い。一方で、資料を渡せば目的を理解して販売まで完走できるかは、別の問いだ。入力条件の不足と、成果物を判断する能力の不足を一緒くたにしたくなかった。
自己監査は96点、さらに100点
後の監査で出てきた点数が強烈だった。96点、100点。高得点だけ見ると、もう公開してよさそうな響きだ。ところがAI自身の再点検では、その点数が主に数式、文面、ファイル形式など、作ったものの内部整合を示していたと分かった。肝心の「初めて買う人が五分で使えるか」は測っていなかった。
採点表の項目が埋まれば高得点になる。しかし、そもそも採点表に入っていないものは、何点を取っても見えない。自分で問題を作り、自分で採点し、自分で満点を宣言する。すごく賢そうに見えるが、受験科目が「自分の得意なこと」だけなら、外の世界で通用する保証はない。ここで初めて、自己評価の点数を販売可否へ読み替えたこと自体が誤りだとはっきりした。

一つのURLのために、何枚のシートが必要なのか
ここでいう「一つのURL」は、Webサイトを一つ作るという意味ではない。AIが販売用に作った表計算ツールで、購入者が作成・管理するリンク一件のことだ。最初の試作品については、元の監査文にリンクの用途までは書かれていない。分かっているのは、リンクを一本作るだけで設定、台帳、監査、10項目の確認を行き来させる設計だったこと。後に参照知識を加えて試した別案では、広告やSNSからの流入元を区別するUTM付きの計測用リンクを作る商品が出た。たとえば https://example.com/product?utm_source=instagram というリンク一件のために、6〜7枚のシートが必要だった。購入者はリンク先と流入元を入力したいだけなのに、複数のシートの使い方を覚えるところから始める。説明書を読む前に仕事が終わりそうだ。
さらに、補助列の0と1や、保護されていない数式が画面に出ていた。開発中の作業台なら理解できる。販売物としては危うい。私は「五分で使える商品」を考えていたのに、完成品は「五分で設定を覚えるのも難しい商品」に近かった。このズレは、表計算ファイルを綺麗に整えるだけでは埋まらない。買う人の操作から逆算する必要がある。

見た目だけではない、実害につながる穴
分かりにくさで済まない問題も出た。承認後にURLを変えても公開可の表示が残る。IDを重複させると、別のURLが以前の承認を引き継いでしまう。未保護の計算セルを書き換えると、未確認でも公開可になり得る。AIの再監査で挙がった例だが、どれも利用者が誤って操作した時に判断が壊れる。
こういう穴は、資料を眺めるだけでは見つけにくい。「普通の人ならどこを触るか」「間違えたらどんな表示になるか」を実際に試すと分かる。セルやルールが正しく並んでいるだけでは安全ではない。購入者が少し雑に使っても壊れないことまで見なければ、商品として安心して渡せない。この時点で公開中止は迷わなかった。
日本の売り場に、英語のドル建て商品を持ってきた
さらに追い打ちがあった。日本国内の販売先へ出そうとしているのに、AIは英語でドル建ての見積もりツールを作ってアップしようとしていた。お金を勝手に使った話ではない。売る場所と商品の言語・通貨が噛み合っていなかった話だ。指摘するまで、そのズレが成果物の大きな問題として扱われていない。
海外向け商品なら英語とドルで筋が通る場合もある。国内向けの商品なら、買う人が読む言葉と価格の感覚は違う。単体のタスクでは「見積もりツールを作る」ができていても、前段の「誰にどこで売る」とつながっていない。ここまで来ると、AIの作業速度が速いほど危険に見える。間違った方向へ高速で走られると、後から人間が回収する量も増える。
全工程を任せると、工程の間で落とす
今回の失敗は、一つの能力が足りないというより、工程と工程の接続が切れた感覚だった。市場調査では市場を見ている。商品制作では商品を作っている。自己監査ではチェック項目を埋めている。それぞれの場面では前へ進んでいるのに、最後に並べると「その市場で、その人が、その商品を買って使う」が成立しない。
人の仕事でも同じことは起きる。調査担当、制作担当、営業担当が自分の数字だけ達成しても、顧客に届かなければ事業としては失敗だ。AI一体に全役割を任せれば、このズレが自然に消えると思ったが、そうはならなかった。むしろ同じAIが役割を切り替えて進む分、誰も横から「待って、買う人は誰?」と聞かない。そこが全任せ実験の盲点だった。
人が見るべき門は、三つでいい
毎操作へ口を出したら実験の意味がない。ただ、全部終わった後に初めて見るのも遅い。次に同じことをするなら、人が止まって見る門を三つ置く。第一に、市場と相手を決めた時。誰がどこで買うか、言語・通貨・使う場面を確認する。第二に、最初の完成見本ができた時。初めて触る人として、一つの作業を最後までやってみる。第三に、公開直前。誤操作や条件変更で表示が壊れないかを試す。
この三つは、AIの思考を逐一監視するためではない。人間がしか持てない正しさの基準を、商品が外へ出る前に差し込むためだ。資料の整合性や計算の確認はAIに助けてもらえばいい。だが「欲しいか」「分かるか」「売り場に合うか」は、自己採点とは別の試験にする。

次の実験では、点数より観察を残す
参照知識を渡した条件でも再実験する価値はある。その時は、96点や100点という数字だけを記録しない。元の依頼、参照した資料、AIが選んだ市場、作った試作品、人が詰まった操作、止めた理由を一続きで残す。どの段階で目的から外れたのか、後から追えるようにする。
もう一つ、評価はAI自身の説明だけに頼らない。AIが「意図してこうしました」「点数は高いです」と言っても、それは原因や品質の証拠にはならない。初見の人に触ってもらうか、自分が購入者になりきって操作する。少なくとも、作り手と採点者が同じままで商品を世に出すのは避けたい。実験結果として必要なのは美しい報告書ではなく、どこで手が止まったかという生の観察だ。
笑い話になったのは、出す前に止めたから
「100点満点のゴミ」は、言葉としては最高に面白い。こんな綺麗なオチはなかなかない。ただ、実際に誰かが買っていたら、私だけのネタでは済まなかった。今回は商品を見て、公開を止められた。だから笑える。自己監査の高得点を信じて販売していたら、購入者の時間と信頼を使って実験したことになる。
最高性能のAIを一日走らせたら何が起きるか。その答えは「何もできない」ではなかった。相当な量を作り、細部の確認もする。それでも、何を価値とみなすかがズレたままなら、完成度の高い的外れを作れる。今回測れた限界はそこだ。能力が高いから全面的に任せられる、とはまだ言えない。仕事の途中に人が立つ意味を、笑いながら痛感した。