AI・機械学習
誰が誰に教えているのか、もう区別がつかない
I can't tell who's teaching who anymore (blog.murphytrueman.com)
要約
AIが生成する文章と人間が書いた文章の区別が曖昧になり、書き手が自身のスタイルを抑圧し、より中立的な表現を選ばざるを得なくなっている現状を論じるエッセイ。AIモデルが人間の言葉を学習し、それが逆に人間の語彙に影響を与えるという循環が、個人の創造性や表現の独自性を希薄化させていると指摘しています。
全文翻訳
最近、記事を書き終えました。公開のためにキューに入れる前にいつもやっていることですが、それを物語の読み聞かせのように、声に出して読みました。句読点の位置、emダッシュがどれだけの「間」を取るべきか、読者がどれだけ省略しても意味を失わない括弧などを、リズムを見つけるために確認します。
しかし最近、この読み返しは「捜索」に変わってしまいました。emダッシュを取り除き、コンマやピリオドに置き換え、変化をあまり目立たなくしながらリズムを一定に保ちます。「genuinely」「honest」「quiet」「silent」「worth」のような言葉を探し、それらをより中立的なものに置き換えます。まるで自分のスタイルを埋葬するかのように。
これらは、デスクトップのファイルに保存されている「Literary Graveyard(文学の墓場)」という名前のファイルに入っている言葉の一部です。そこには、人々がAI生成と判断するのではなく、自分で書いたと感じさせるような、見慣れた言葉、フレーズ、パターンが満載です。私は、Slackチャンネルでの議論、LinkedInの投稿、そして文法的には正しかったとしても、AIが書いたと誤解されるのを避けるためにemダッシュを削除するようにと頑なに主張していた元上司からの直接的なコメントなどから、それらを見つけました。
最も腹立たしいのは、それらは最初に私のものであったということです。私自身、多くの人がそうであるように、AIモデルが登場するずっと前から何年もこのように書いてきました。機械は、私のような人々からそれらの言葉、構造、パターンを学習し、それらが自分のものだと感じなくなるまで、私に繰り返して返してきました。デザイントークンについて書きたいだけの人にとって、これはかなりの自己検閲です。
これは、私が長年プロダクトやデザインシステムで経験してきたループに似ています。何度も見てきました。システムにパターンを導入し、人々がそれをコピーし、しばらくすると、コピーされたことが証明になります。どこにでもあるので、それが正しかったに違いありません。時には、システムはすでに機能していたものをカタログ化しているだけです。他の時には、それは何もないところから行動を発明し、その広がり自体を判定として扱います。仕事の半分は、どちらのケースだったのか、実際に誰かが選んだのか、それとも単に積み重なっただけなのかを追跡することです。
私は今、言語でも同じループを見ていますが、監査する対象がありません。どちらの方向に影響が流れているのか、もう区別がつきません。
言葉は最初に私たちから来た
AIについて初めて知ったとき、モデルは独自の語彙を発明するものだと Assume していました。実際には、そうではありません。フロリダ州立大学の研究者は、ChatGPTがなぜ「delve」という言葉を頻繁に使うのかを理解しようとしました。原因は、人間がモデルの回答を評価して「良い」とは何かを教えるフィードバック段階にあることが判明しました。
研究者たちがそれをテストしたとき、読者は「delve」という言葉を他のどのバズワードよりも低く評価しました。したがって、これは人々が愛する言葉をモデルがコピーしたわけではありません。トレーニングのある時点で、特定の人間レビュアーのグループがそれを「delve」へと誘導し、モデルはその教訓を学びました。私たちが今、眉をひそめるような言葉は、ある部屋の人々が報酬を与えたもののスナップショットから始まったのです。それらは最初に私たちから来たのです。
それから、それは戻ってきました。
マックス・プランク研究所の研究者たちは、737,000時間以上の非スクリプト化されたポッドキャストを聞き、ChatGPTのリリースと「delve」のような言葉の増加を直接結びつけることができました。モデルと十分に時間をかけて話すと、その言葉が自分の語彙に現れ始めます。
影響は逆転しました。私たちはモデルに教え、そしてモデルは私たちに教えていました。
そして、それはもう一度元に戻りました。
「delve」がジョークのネタになると、人々はChatGPTが存在する前よりもそれを使う頻度が少なくなりました。実際、それがあまりにも頻繁に使われなくなったため、新しいモデルはそれを使わないように調整されました。私たちは機械のように聞こえないように自分自身を編集し始めましたが、機械はそのように聞こえないように編集されました。
私の「墓場」ファイルは、まさにこの真ん中にあります。そこにあるすべてのエントリは、モデルが行ったことのために自分の文章を編集している私自身です。ポッドキャストのホストが「delve」で行ったのと同じ動きですが、逆方向です。
中央に向かって
これがどこに行き着くのかには名前があります。モデル崩壊です。2024年、Natureは他のモデルの出力をトレーニングした場合に何が起こるかについての論文を発表しました。まれで具体的な詳細は最初に消えます。ラウンドを重ねるごとに、珍しいものは平均化され、9ラウンド目までにはその糸は完全に失われます。
デザインシステムで働いているなら、これは別の名前で知っているでしょう。私たちはそれをドリフトと呼びます。システムが意味をなさなくなるのは、すべてのチームが独自のカスタムバージョンにそれを曲げ続けるため、共有された標準が残らなくなるからです。私が説明しているのは逆方向です。散らばるのではなく、すべてが中央に向かって引っ張られます。まれで特異なものは削り取られ、残るのはそのものの最も普通のバージョンです。最も複雑で人間的な部分は最初に失われます。
私が墓場に移動するすべての言葉は、私自身が手作業で文章を平均化しているということです。トレーニングループがスケールで適用するのと同じプルですが、より遅く、一度に一つの決定です。私はそれを防御だと自分に言い聞かせていました。そうではありません。
母が教えてくれたこと
私は今、記事、ニュースレター、LinkedInのコメント、ドキュメントを読むときに、これらすべてを最も強く感じます。1年前なら、それが実体験から生まれたものかどうかを通常判断できました。しかし最近、その線はぼやけてきました。取り込む前に、自分で避けるように訓練した手がかりを探しますが、それが読書と同じくらい文章を書くことを重く感じさせています。そして、私が教えられた構造が、私を知らない人には手がかりと解釈される可能性があるため、書くことを恐れていました。
その構造は母から来ました。彼女はライティングを学び、チェンジマネジメント、テクニカルライティング、eラーニングのキャリアを築きました。複雑なことを理解できる断片に分解することです(聞き覚えがありますよね?)。幼い頃から、彼女は私にできるだけたくさん読み書きするように勧めてくれ、私はそれを愛しました。私が文章を構築する方法の多くは、彼女から来ています。そして、クリアで構造化されたテクニカルライティングは(残念ながら…おそらく?)これらのモデルがトレーニングされているものです。
私が墓場に埋めている言葉は、私のようなライターが最初にそのように書いたため、機械が書いたように読まれます。ある意味で、私は彼女から学んだものと同じように聞こえないようにするために、彼女自身の文章から彼女を編集していました。それは考えるのが不快なことです…彼女が私にくれたもの(そして私が最も大切にしているもの)の一つが、今や機械のように間違われる可能性が最も高いものになっているのです。
それが私をとても悩ませていたので、スパイラルし始めた数日後に彼女に電話しました。典型的な母親らしく、彼女は私が自分自身を縮小したり、他人に迎合するために書き方を変えたりしてはならないとすぐに私に言いました。しかし、それでも私は各ドラフトを百回も確認するのをやめられません。
そこで、検出器が実際にどのように機能するのかをよりよく理解しようとしました。それは、私が心配していたことを愚かに感じて、書くすべてのものを過度に分析(そして過度に編集)するのをやめられるようになることを期待していましたが、そうはなりませんでした。それは一般的に2つの主要な点に集約されます。あなたの言葉がモデルが選ぶ言葉であるかどうか、そしてあなたの文の長さが似ているかどうかです。あなたがきれいに、均一に、そして分かりやすい方法で書けば、これらのモデルがフラグを立てる帯域に快適に収まります。それが私が書くように教えられた方法です。私の母が何年も私に植え付けた習慣は、今や見知らぬ人が機械のものとして読む習慣になっています。それは信じられないほど奇妙で憂鬱なことです。
これは単なるソフトウェアの問題でもありません。ポッドキャスト調査を実施した研究者は、彼らがフラグを立てた言葉が、スキルの低さ、または怠惰なAIの使用の兆候として読まれ始めていると警告しています。彼らが話している言葉は機械の発明ではありません。それらは、長年の読書から得た、単に良い言葉です。モデルがそれらを放射能にしたずっと前に、注意深く、几帳面なライターが手を伸ばしたような言葉です。それが私を最もイライラさせることです。書くことを学んだ人々、語彙を構築した人々が、それが機械のものとして読まれるのを見守らなければならないのです。
私は構築しました