質問で埋まる情報と、案を見て決まる希望
AIに社内向けの記事を頼むとき、公開先や締切は質問に答えれば決められる。 しかし、専門的な説明をどの程度残すかは、原稿を読んで初めて判断できる場合がある。 この二つを同じ曖昧さとして扱うと、質問を重ねても決まらないか、先に確認できた条件までAIが推測してしまう。
不足している事実には確認質問が役立つ。 ClarifyGPTは、コード生成の要件に曖昧さがある場合に質問を作り、回答を受けて要件を更新する方式である。 10人が参加した評価では、MBPP-sanitizedにおけるGPT-4のPass@1が70.96%から80.80%へ改善した。 Pass@1は最初に生成したコードがテストを通る割合であり、任意の開発業務で同じ改善が出るという数字ではない。ClarifyGPT
一方、まだ本人にも言葉にしにくい希望には、比較できる案が判断材料になる。 本稿は、質問と試作をこの違いに合わせて使い分けることを勧める。 入力形式と正解がすでに定まった変換作業まで、試作品の往復を必須にする提案ではない。
途中結果を見せる研究が確かめたこと
AI Chainsは、複数の処理をつなぎ、その中間結果や処理自体を利用者が修正できる仕組みを調べた。 20人の研究では成果の品質に加えて、処理の見通しや制御のしやすさが改善した。 誤りの出た段階を調べられることが、この仕組みの特徴である。 これは「最初に完成原稿を見せれば、どんな仕事でもうまくいく」という実験ではない。AI Chains
画像生成の研究では、AIの理解を人が編集できる図にし、確認質問も組み合わせている。 参加者の少なくとも90%がこの仕組みを役立つと評価した。 ただし、その評価から図の効果と質問の効果を個別に切り分けることはできない。Proactive Agents for Multi-Turn Text-to-Image Generation
両研究から本稿が採るのは、完成後の評価だけでなく、誤解がある段階を見つけて修正できるようにするという設計である。 何を見せれば判断できるかは仕事によって異なる。 記事なら構成案、画像なら登場する物や配置、コードなら期待動作を示すテストが候補になる。
記事の構成案を直す想定例
以下は、途中結果が何を判断させるかを示す想定例である。 「技術者以外にも読めるAI導入の記事」という依頼に、AIが製品名から始まる構成を返したとする。 依頼者は全文を読まなくても、「製品比較の前に、何の仕事を改善する話か知りたい」と指摘できる。
次の依頼では「営業担当者が会議後に記録を直す例を導入に置く。製品比較は残すが、比較する項目を先に説明する」と変更内容を指定する。 AIは構成と冒頭だけを更新する。 依頼者は、導入から比較へ進む理由が分かるかを確認し、決まった構成を使って本文を広げる。
このやり取りで決まったのは説明の順序である。 製品が実際にできることや、導入効果の数値が正しくなったわけではない。 本文を書く段階では出典との照合が別に必要になる。 確認質問がコードの期待動作を明確にする場合のように、対話と正確性の改善が重なることもあるが、利用者の納得を事実確認の代わりにはできない。
会話を重ねる際に残すもの
修正を続けるなら、古い前提を引き継ぐ失敗にも備える。 Microsoft Researchの研究では、六種類の生成課題について条件を一度に与える場合と複数回に分ける場合を比較し、後者の性能が平均39%低下した。 20万件以上の模擬会話の分析では、初期の推測に依存し続ける問題が報告された。 これは条件の伝え方を比較した結果であり、会話が長いほど一律に性能が下がると測ったものではない。LLMs Get Lost In Multi-Turn Conversation
記事の例なら、構成が決まった時点で対象読者、中心の問い、残す例を短い依頼文にまとめ直す。 修正前の版を残し、次の版で指定していない主張が変わっていないかも見る。 指摘が反映されない場合は、回数だけ増やさず、変更対象や判断基準を見直す。
共同作業を終える基準
記事では、読者と問いに合う構成になったか、各主張の根拠を示せるか、数値の条件が欠けていないかを確認して終える。 見た目への満足だけで公開せず、改善点がないのに対話を続けることも避ける。
試作品を使う意味は、依頼者がまだ説明できない希望を、変更可能な対象に結び付けることにある。 先に答えられる条件は質問で確かめ、案を見て決める点には途中結果を使う。 その判断と、出典やテストによる検査を組み合わせれば、次に何を直し、何を確かめるかが明確になる。