こんばんは! 管理人の緑茶です。
皆さんは「sycophancy」という言葉をご存じでしょうか。日本語では「迎合」「追従」などと訳される言葉で、AI研究では、モデルが事実や独立した評価よりも、ユーザーの意見や期待に過度に合わせてしまう傾向を指します。
今回、文章評価という分野でAIの実力診断を行ったところ、この「迎合傾向」に近い挙動がいくつか見られたのでご紹介します。
なお、今回試したClaude、ChatGPT、Geminiでは、強弱や言い回しの違いこそあれ、似た傾向が見られました。ただしサンプル数は少なく、モデルやバージョンによっても結果は変わるため、あくまで個人的な実験結果としてお読みください。
実力診断方法
あるテーマについて、人間と各種AIがそれぞれ3000字程度の小説やアニメレビューを作成します。そして各AIには、どの文章を人間が書いたのかを伏せた状態で、評価・採点・順位付けをしてもらいました。
① 書き手を伏せた状態で評価
まず、作者を一切明かさずに文章だけを評価してもらいます。
今回のサンプルでは、AIごとに生成文の特徴がありました。Claudeは比較的安全で無難な文章、ChatGPTは正確性を重視した文章、Geminiはフレンドリーな文章という傾向です。
評価結果は、おおむね「ChatGPT > Claude > Gemini」で、人間の文章はGeminiの前後に並びました。
評価理由を読む限り、まず文章の正確さや整合性が重視され、次に安全で無難な構成が評価される傾向に見えました。一方、人間の文章は誤字脱字、文のねじれ、意図的な体言止めなど、内容以前の文章上の粗さで減点される場面が多くありました。
② 一度評価した文章へ、人間が補足情報を加える
次に、すでに評価されたGeminiの文章について、私が作者のように振る舞い、意図や意味について補足しました。
するとGemini文章の評価が上がり、Claudeとほぼ同等になりました。
ここで興味深かったのは、すでに確定した他作品の評価はあまり動かず、追加された情報がGemini文章への加点材料として使われたことです。
もちろん、新しい情報を得て評価を更新すること自体は正しい行動です。そのため、これだけで「AIが迎合した」と断定することはできません。ただ、一度提出された文章でも、後から与えられる説明や主張によって評価がかなり動くことは確認できました。
③ 匿名評価後に、書き手を開示
次に、①で評価した文章について「これは人間」「これはChatGPT」など、作者情報だけを追加しました。
この場合、順位や点数はほとんど変わりませんでした。ただし評価文には「人間らしい味がある」「AIらしい正確さがある」といった、“らしさ”への言及が増えました。特に人間文章へのフォローは雄弁になった印象です。
一度文章だけで評価が固まると、後から作者を知っても点数そのものは維持しようとする。一方で、評価理由には作者情報が反映されるようでした。
④ 最初から書き手を開示して評価
すると順位が変化しました。
今回のサンプルでは「ChatGPT > Claude ≒ 人間 > Gemini」となり、人間の文章が匿名評価時より上がりました。
評価理由を見る限り、正確さや安全性を重視する傾向自体は変わりません。しかし「人間ならではの切り口」「面白さ」「個性」といった新しい加点軸が現れ、人間文章の評価を押し上げていました。
③では後から人間だと明かしても点数は変わらなかったのに、④では最初から人間だと知ることで評価そのものが変わった。
ここが今回、一番興味深かった部分です。
文章だけを評価しているように見えても、実際には「評価を始める時点でどんな情報を与えられているか」によって、AIが何を評価軸として重視するのかまで変わる可能性があるようです。
総評
サンプル数が少ないため、今回の結果だけで断定はできません。
ただ、この実験から少なくとも、AIによる文章評価には次の傾向があるように感じました。
後から与えられた補足や意見によって、評価が動くことがある。
一見すると絶対評価をしているようでも、評価は会話の文脈や事前情報に影響される。
最初から「人間が書いた」と知っている場合、「人間らしさ」「個性」といった別の評価軸が加わることがある。
これは、AI研究で「sycophancy」と呼ばれる迎合傾向や、評価時のラベル・文脈によるバイアスに近い現象だと思います。
AIは固定された信念を持った審査員ではありません。入力された文章だけではなく、その前後にある情報も含めて回答を作ります。そのため、使い方によっては公平な評価者として少し不安定です。
しかし、私はそれを全面的に悪いことだとは思いません。
公平な採点をしてほしい場面では、作者を伏せる。新しいチャットを使う。評価基準を細かく決める。追加の補足を入れない。複数回評価して結果を比較する。そうすれば、かなり影響を減らすことができます。
逆に、創作の壁打ちでは事情も意図も全部伝える。そして良いところや伸ばせるところを一緒に探してもらう。
SNS時代は、良くも悪くも他人の実力や、自分からは果てしなく遠く見える高みまで簡単に目に入ります。心が折れそうになったとき、後ろから押してくれる存在は、それがAIであっても良いアドバイザーになり、モチベーション維持の役にも立つと思います。
大事なのは、AIの励ましと、公平な評価を同じものだと思わないことです。
ですから、文章を書く皆さん。ぜひAIと壁打ちしてみてください。良いところを見つけてもらい、改善点を探し、創作の推進力に使ってみるのも面白いと思います。
ただし、AIがいつでも公平な審査員とは限りません。
褒められて気持ちよくなったときほど、少しだけ「本当にそうかな?」と疑ってみる。
裸の王様にならないように、ご注意くださいね。











