AI・機械学習
人間は読めるがAIは読めないフォント
A font that humans can read but AI cannot (mixfont.com)
要約
Ghost Fontは、人間の目には読めるが最新のAIモデルには解読が困難な、動きを利用したメッセージ伝達方法です。動画やノイズ、デコイ(おとり)メッセージを組み合わせることで、AIの視覚認識の限界を探る実験的な試みであり、将来的なCAPTCHAシステムへの応用やAIの知覚能力のベンチマークとしての可能性も示唆されています。
全文翻訳
Ghost Font
AIに読めない、人間が読めるフォント。
以下にテキストを入力し、メッセージを含むビデオクリップをダウンロードして共有してください。
メッセージを入力してください:10/36一時停止反転速度120px/秒リセットメッセージをダウンロード
Ghost Fontとは?
Ghost Fontは、動きを使ってメッセージを作成するAI対策フォントです。動き、ビデオ、ノイズ、デコイを組み合わせることで、他の人間とメッセージを共有するユニークな方法です。厳密には、従来のTTFフォントファイルのようなフォントではありません。しかし、Ghost Fontは、AIが容易に理解できない形式で、視覚的に書面でコミュニケーションする方法の実験です。通常のテキストほど可読性は高くありませんが、文字は人間の目にはすぐに読み取れますが、最新のAIモデルでさえ容易に解読できません。
お使いのブラウザはビデオ要素をサポートしていません。
Ghost Fontで生成されたビデオの例。
Ghost Fontで生成されたビデオは、Claude FableやGPT Sol 5.6 Ultraのような最新のAIモデルに渡されました。これらの最新のエージェントでさえ、正確なテクニックを指示されない限り、動くメッセージを解読するのに苦労しました。
GPT-Sol 5.6 UltraがGhost Fontで書かれたメッセージを解読しようとしています。モデルは隠されたデコイメッセージを読み取りますが、実際の動くメッセージを読むのに失敗します。
Max推論を搭載したClaude FableがGhost Fontで書かれたメッセージを解読しようとしています。モデルは隠されたデコイメッセージを読み取りますが、実際の動くメッセージを読むのに失敗します。
上記のプレイグラウンドは、このコンセプトのプロトタイプにすぎません。数語入力すると文字が表示されますが、それはドットの動きが人間の目に可視であるためです。
ビデオを一時停止すると、静止したドットが混ざり合い、単一のフレームを見ただけでは埋め込まれたメッセージが何であるかを判断することが不可能になります。つまり、ページをスクリーンショットしてもメッセージは明らかになりません。
この実験はローカルで機能します。メッセージを入力してライブでプレビューするか、ビデオをダウンロードして自分で共有・テストできます。データは共有されたり、サーバーに送信されたりしません。
このプロジェクトについて
2013年、デザイナーのSang MunはZXXというフォントをリリースしました。これは、人間には読めるがOCR(光学文字認識)ソフトウェアには読めないように設計された4つのフォントを持つタイプフェイスでした。文字はノイズでカモフラージュされ、取り消し線が引かれ、偽のマークの下に埋め込まれていました。当時、このフォントは「監視防止」と見なされていましたが、今日では、最新のAIエージェントはZXXでレンダリングされたテキストを簡単に読み取ることができます。ZXXフォントの例
これは2013年のOCRソフトウェアには対応できたかもしれませんが、最新のAIモデルはZXXのテキストを pretty easily 読み取ることができます。この画像をInstantモードのChatGPT 5.5にコピーしましたが、単一のプロンプトで、いくつかの小さな詳細も含めて単語を取得することができました。
ChatGPTがこの画像のテキストを簡単に読み取ります。
しかし、Ghost Fontで同じプロセスを行っても、それほど簡単にはいきません。Ghost Fontの単一のスクリーンショットは、読み取り可能なテキストのない完全に静的な画像しか生成しません。なぜなら、Ghost Fontの各文字は背景と全く同じように見えるドットで構成されているため、ビデオのどの単一の画像もメッセージに関する何も明らかにしないからです。
ChatGPT 5.5 ProでGhost Fontを試す。
19分間の分析の後、ChatGPT 5.5 Proは存在しないメッセージを幻覚しました。
しかし、単にビデオにメッセージを隠すだけでは完璧な解決策ではありません。オンラインモデル環境は個々のフレームからそれを取得できないかもしれませんが、ローカルのコード実行環境を持つ専用のエージェントは、ドットの動きを分析してメッセージをデコードすることができます。Ghost Fontはこれを別のレイヤーで解決します。各ビデオ生成にはデコイメッセージが含まれています。
デコイメッセージは、決意したエージェントのための最終的なトリックとして機能します。隠されたメッセージを探している場合、まずデコイメッセージを見つけて、それがビデオに埋め込まれた実際のメッセージだと考えるかもしれません。それが、Ghost FontがFableやGPT Sol 5.6 Ultraのような最も強力な思考モデルからさえメッセージを隠すことができる方法です。
最終的に、メッセージを真に隠す方法は、暗号化、または何らかのキーを使用することです。人間だけが知っている特定のパスワードを解除する必要があるメッセージを、どのAIも読むことはできません。しかし、このプロジェクトは、AIモデルが容易に読めない視覚的なメッセージを含む共有可能なファイルを作成することが可能かどうかを探求しています。
私たちは、AIの知覚の限界を探求すると同時に、人間のものを保存する方法として、この実験を作成しました。AIがフォント生成を引き継ぐにつれて、人間が独自の創造的な声を持ち続けることを願っています。
次は何?
Ghost Fontには、さらに探求したい興味深い意味合いがあります。例えば、Ghost FontをCAPTCHAシステムに組み込むことは興味深いでしょう。なぜなら、ほとんどのシステムは今日AIによって簡単に解決されてしまうからです。ビデオ内の動きを使用することは、自動化されたボットが解読するのを非常に困難にしながら、人間にとっては比較的簡単に読めるようにする方法です。
Ghost Fontは、視覚的知覚に関するAIの進歩をベンチマークするための興味深い方法にもなり得ます。現在、マルチモーダルモデルは画像ベースであり、ビデオが渡されても、通常はビデオをフレームに分割して個々のフレームを分析します。近い将来、テキストを直接読み取ることができるビデオネイティブモデルが登場すると予想されます。
最後の教訓は、AIが確かに非常に良くなっているということです。Ghost FontはAIにとって読みにくいですが、人間にとっても pretty hard to read です!ギャップは閉じ続けています。AIの知覚とマルチモーダルモデルに関して、将来何が起こるかを見るのは興味深いでしょう。
次のステップとして、ビデオ生成のコードをオープンソースプロジェクトとしてリリースする予定です。乞うご期待!また、サイズを拡張し、より長いテキスト文字列を扱えるようにしたいと考えています。この実験を楽しんでいただけたなら幸いです。ご意見をお聞かせください。X(旧Twitter)では@ericluで私を見つけることができます。- Eric