動画記事 · AI Engineer
プロンプトは依然としてパンチカード - Ted Johnson、JoinIn AI
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
現在のプロンプトは本質的に「パンチカード」のバッチ処理プロトコルに過ぎず、AI の真の可能性を引き出すには人間が機械に合わせている現状から、双方向対話型インターフェースへの転換が必要である。
プロンプトは「パンチカード」のままでいいか:AI 活用のパラダイムシフトを迫る真実
現在の AI 利用において、私たちは「プロンプト」という名のもとに、1980 年代のパンチカード処理と同じ非効率なルールの下に縛り付けられている。キーボードや自然言語という媒体は進化したが、人間が意図をパッケージ化して機械に送り、結果を待つという根本的な「プロトコル」には変化がないのだ。
この不整合こそが、AI を使いこなせないと感じる人々の悩みや学習コストの正体である。真の AI 活用とは、単なるプロンプトの書き換えスキルを磨くことではなく、AI が思考過程で人間に介入・質問できる双方向対話型インターフェースへの設計転換にある。
プロンプト操作は「バッチ処理」の延長だ
私たちが日常で使っている AI 操作の姿を一度振り返ってみよう。小さな入力ボックスにリクエストを書き込み、送信ボタンを押す。カーソルの点滅やローターが回るのをじっと待ち、結果を見て「もっと詳しく」と書き換えて再送する。この一連の流れは、一見すると対話的に見えるかもしれない。
しかし、JoinIn AI の共同創設者テッド・ジョンソン氏はこれを「バッチ処理」と呼び切る。これは、パンチカードが主流だった時代の業務プロセスと本質的に同じだ。
パンチカードによるバッチ処理とは、機械から離れた場所でリクエスト全体を注意深くエンコードし、事前に用意したカードセットをオペレーターに渡してジョブを提出する。その後、時には数時間、時には一晩中待つのだ。思考している間も機械はあなたと対話しませんでした。
現在のプロンプト操作もこれと同じだ。人間がすべての文脈や意図を事前にパッケージ化し、機械に送り出すまで機械は待機する。結果が間違っていれば、また人間が修正して再提出する。この「送信→待ち→確認→再送」のサイクルこそが、パンチカード時代のバッチ処理そのものである。
音声入力を使っても状況は変わらない。マイクから発せられた言葉は、単にテキストに変換されてボックスに貼り付けられ、同じように送信されるだけだ。「短いバッチ処理であっても、依然としてバッチです」とジョンソン氏は断言する。速度が数秒になったことでインタラクティブになったと錯覚しているに過ぎない。
チャネルと表現は進化したのに「プロトコル」だけが取り残されている
なぜ私たちはまだ AI を学ぶ必要があるのか。その答えを知るには、インターフェースを構成する 3 つの要素——チャネル(媒体)、表現(意味の範囲)、そしてプロトコル(相互作用のルール)——を分解して見る必要がある。
チャネル:変わっていない入力手段
キーボードやマイク、画面といった「チャネル」は、実はここ 150 年以上ほとんど進化していない。私たちが毎日使っている QWERTY キーボードのレイアウト自体が、1860 年代のパターンを引きずっている。
私たちは、何世紀も前から存在しない制約の下で設計された任意の入力装置の遺産を、自分たちとこれまでに作られた最も能力の高い機械との間に置いている。生きている誰もこれを選んだわけではない。私たちは皆、それを継承しただけだ。
キーボードは「チャネル」に過ぎない。テキストが離散的な記号のストリームであるか、音声にはタイミングやためらいが含まれるかという違いはあるが、媒体そのものが伝達する情報の質を根本から変えるわけではない。
表現:飛躍的な進化
一方で、「表現」という軸では劇的な変化があった。アセンブリ言語やシェルコマンドのように、機械が受け入れる限られたメニューから意図を選ぶ必要はなくなった。自然言語の登場により、私たちは他人に話すように、ほぼ何でも機械に伝えられるようになった。
通常人間の要求には意味の海があり、文脈、ニュアンス、意図など、これまでに互いに明確にする必要がなかったすべてが含まれています。初めて、あなたはほぼ何でも他人に話すように言えます。
この「表現」の自由度は、LLM(大規模言語モデル)の登場によって爆発的に広がった。しかし、チャネルと表現が進化しても、プロトコル——つまり、人間と機械がどう相互作用するかというルール——だけは進化していないのだ。
プロンプトエンジニアリングは「魔法の言葉」ではなく「パンチカード操作」だ
私たちが「プロンプトエンジニアリング」と呼んで習得しようとしているスキルは、実は高度な知能を扱うための新しい能力ではない。それは、パンチカードオペレーターが持っていた熟練さに過ぎない。
ステップバイステップで考えさせよと指示する。例を与え専門家になるよう頼む。より多くのコンテキストを貼り付け、Markdown ドキュメントを通じてのみ対話せよ。
これらはすべて、「ジョブが失敗しないようデッキ(カード)を組み立てる方法」を正確に知るためのルールだ。魔法の言葉を交換しているように見えるが、それは単に見栄えの良い名前を付けただけの古き良きバッチ処理のパッケージ化ルールである。
この不整合こそが、ユーザーが「自分は AI が苦手だ」「具体性が足りない」と自分を責めてしまう原因だ。ジョンソン氏は明確に言う。
それは私たちのせいではありません。私たちは AI を使いこなせていないわけではありません。私たちはパンチカードのプロトコルを通じて、全く新しい種類の知能を操作させられています。
モデルの推論能力、記憶力、計画能力が上向きに進化している一方で、インターフェースのプロトコルは平坦なまま。人間が文脈の重要性を決定し、タイミングを選び、曖昧さに気づき、出力を修正する負担をすべて背負わされているのだ。
双方向対話型インターフェースへの転換:AI が「会話」に参加する時
真の解決策は、AI が思考の途中でも人間に介入・質問・修正できる双方向対話型インターフェースへ設計を転換することだ。MIT のシェリー・タークルが言うように、「対話は、私たちが行う最も人間的で、人を人たらしめる行為」である。
AI が思考の中間で私たちに会い、織機のプロトコルを受け取る可能性があります。それは人間らしい対話です。
現在の「プロンプトボックス」は、誰が話しているか、言葉が自分に向けられたものかどうかを判断する仕組みを持たない。例えば、AI に話しかけるふりをしたユーザーに対して、「あなたに話しかけていません」と返すことができないのだ。
しかし、次世代のインターフェースでは状況が変わる。Nvidia の研究モデル「Personal Plex」や OpenAI の最新機能のように、バックチャネル(裏側での反応)が実装され始めている。
会話の流れを超えて、多くの課題があり、これは複雑です。聴覚的な反応をすることと、誰が部屋にいるかを知っていることは実は同じではありません。
新しいインターフェースでは、AI は会話を「追跡」し、「理解」し、適切な瞬間に発言する機会を得る。会議の参加者を特定し、誰が話していないかを判断し、必要な情報を補完する。ユーザーはプロンプトを書く必要もなく、システムが会話に参加している。
人間中心設計への回帰:機械に適応するのをやめよう
過去 75 年間、私たちは機械に意図を伝えるために構文や形式、タイミング、バッチ処理に合わせて適応してきた。しかしこれからは逆だ。AI がユーザー向けなら、インターフェースの最大化に没頭すべきである。
過去の 75 年間、人間は機械に適応してきました。推論し、聞き取り、推測し、適応できるシステムが、少なくとも半分でも私たちを迎えるべきです。
デザインの問いを変える必要がある。「機械が以前は負担を担えなかったため、人間にのみ課している負荷とは何か」という視点だ。答えは常にチャットや音声、マークダウンの壁にあるわけではない。人間同士がすでに使っているアフォーダンス——コミュニケーション、質問、一時停止、スケッチ、チェックリスト、静かな一言、あるいは何も言わないこと——こそが正解になる。
適切なタイミングで適切なチャネルを選ぶことが AI によって行われるようになります。人々の負担を取り除けば、摩擦は消え、採用が追従します。
AI は単なる知能技術ではない。それはますます「インターフェース技術」へと進化している。プロンプトという名前の下で隠れた古いパラダイムから脱却し、人間の可能性を拡大するものとして AI を捉え直す時が来ている。
私たちはパンチカードのルールに縛られたまま、魔法のような知能を扱おうとしている。インターフェースのプロトコルこそが、AI 活用の真のボトルネックであり、ここを変えることが次世代の AI エンジニアリングと UX デザインの核心となるのだ。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。