HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

1866年のように書く:LLMは電信体(Telegraphese)を再学習する

Write Like It's 1866: LLMs Relearn Telegraphese (fiveminutesforward.com)

46 pointsby Theory4235 コメント

要約

大規模言語モデル(LLM)は、19世紀の電信通信で使われていた圧縮された簡潔な文章スタイル「電信体(Telegraphese)」を再学習できることが判明しました。このスタイルは、トークンあたりのコストが高いという現代のLLMの課金体系と類似しており、モデルに指示するだけで、コンテキスト量をほぼ倍増させたり、コストを半減させたりする大幅な最適化が可能です。モデルの選択や、圧縮をどの段階で行うかが重要となります。

全文翻訳

以下はすべて再現可能です — ハーネス、フリーズレジャー、ワンクリックノートブック:github.com/Travis42/telegraph-test。 約1,300の質問からなる50のパッセージのベンチマークからの数値: クロスファミリーマトリックス(リーダー=GLM-5.3-Flashの記録から外国モデルが回答する;ライター=GLM-5.3-Flashが自身の記録から回答する) 1示された節約率は、各プロバイダー自身のメーターで、小文字の指示を使用したものです。その単語がないと、モデルはすべて大文字で電信体を書き、スタイリングには14〜19ポイントかかります:gemma 25.0%、qwen 29.8%、GLM 33.9%。*gpt-5-miniは推論を無効にできず、圧縮により思考するため — その書き込みは通常の倍の請求になります。このテクニックがペイしない唯一のファミリーです。 モデル 役割 プレーンテキスト精度 電信体精度 回復率(1.00 = プレーンテキストコントロール) トークン節約 gemma-4-31b リーダー 70.9% 77.5% 1.09 — qwen3.8-27b リーダー 72.3% 79.4% 1.10 — nemotron-3-120b リーダー 76.1% 76.7% 1.01 — gemma-4-26b リーダー 71.8% 76.9% 1.07 — gemma-4-31b ライター —— 1.09 40.4% qwen3.8-27b ライター —— 1.10 48.9% gpt-5-mini ライター —— 0.99 17.7% *GLM-5.3-Flash自体:小文字の指示で48.4%の節約、ファミリー内回復1.09。 2リーダーは条件ごとに694の固定質問に回答します;ライターの記録はGLM-5.3-Flashによって読み取られます — この投稿のすべての実行におけるすべてのGLM呼び出しはz.aiコーディングプランの高速バリアントであるglm-5.3-flashです。マトリックスの比較ではプレーンテキストを支持するものはありません;すべての比率は0.99–1.10です。 条件ラダー — 同じ質問、一度に1つの変数: 条件 回答モデルが受け取る/行うこと 固定精度 プレーンテキストコントロールとの比較 パッセージ、プレーンテキストでの回答 完全なパッセージ 91.5% 1.00(参照) パッセージ、電信体での回答 完全なパッセージ、簡潔なレジスタ 74.4% 0.81 └ + プレーンテキストに転写 それらの簡潔な回答、展開済み 78.8% 0.86 プレーンテキスト記録 プレーンテキストの要約 75.8% 1.00(参照) 電信体記録 圧縮された要約 82.5% 1.09 デコード済み記録 電信体記録、展開済み 81.6% 1.08 ダウンストリームモデルは、例が示されたことのない4つのファミリーを含め、圧縮された記録からプレーンテキストからと同じかそれ以上の精度で質問に回答します — 回復率0.99–1.10、ここで1.00は「プレーンテキストと全く同じくらい良い」を意味します。レジスタは私たちが発明した構成ではありません(LLMは圧縮された記録をそのまま渡され、同等に読み取りました) — その能力はすでに重みの中にあり、1世紀半にわたる人々が帯域幅をメーターで計測しながら書いてきたことから受け継がれています。 保持結果の解釈。電信体記録は通常の応答よりもわずかに良く読み取れます(ラダーの1.09)。これは、圧縮が厳密な採点が罰する「記録のコピー」のフレーズを抑制するためである可能性が最も高いです。 テストされたすべてのモデルがこれを実行できます。それはトレーニングデータに含まれています — しかし、同一の指示の下で圧縮率は25%から49%まで変動します。このモデルごとのばらつきは、このテクニックを使用したい場合に知っておく価値があり、それは知ることが可能です。 わずかな情報再構築コストがありますが、個々の回答をユーザーに転写する場合のみです。消費者がモデルである場合 — または記録が単に再読み取りされる場合 — 再読み取り率は適用されるものであり、それらはすべて≥0.99です。 3統計的に:プレーンテキストを支持する比較はありません;ファミリー内再読み取りp<0.0001、デコード済み記録p=0.03。 ストレージループの経済性。展開は節約分の約3分の1を返しますので、人間が読める展開済みアーカイブは依然としてプレーンテキストよりも安価です。 これが何を意味するかを考えてみてください: 新しいハードウェアなし、トレーニングなし、API変更なし、1文の指示。 エージェントは圧縮エンドでほぼ2倍のコンテキストを得るか、または半分の出力料金で同じ作業を行います。それは検証済みの大きな最適化であり、私の知る限り、まったく行われていません。 圧縮はいつ無料になるのか? #圧縮ステップがどこに配置されるかによります。モデルがまだ作成中の間に圧縮する(電信体での回答、0.81、0.86で部分的に回復可能)と、レジスタ税を支払います。しかし、コンテンツが確定した後、機械が読み取る記録に圧縮する場合(1.08–1.09)、支払うものはありません。 電信体は「コンテンツ確定」と「機械消費」の間に位置します:スクラッチパッド、メモリストア、エージェント間ハンドオフ。モデルがまだ思考中の場所ではありません。 推論を無効にできるモデルは、圧縮をクリーンに請求します。gpt-5-miniの推論は必須です(APIはそれをオフにすることを拒否します)、そして電信体はそれを約3倍困難にさせます — 短いテキストにもかかわらず、その書き込みは倍のコストがかかります。教訓は、思考を制御できるモデルで圧縮する必要があるということです。 したがって: LLM請求書の高価な半分は、機械消費テキストのためのオプションのオーバーヘッドです。出力トークンは入力トークンより3〜5倍のコストがかかり、モデルが別のモデルのために書くトラフィックについては、主要なAPIのいずれかで半分が削減されます — 1文の指示、トレーニングなし、セットアップなし(必須推論モデルを除く)。 エージェントのメモリはほぼ2倍になりました。スクラッチパッドと要約を電信体で保存します:モデル — 意図された読者 — は、テストされたすべてのファミリーで同等かそれ以上の精度で読み取ります。人間が実際に確認するときだけプレーンテキストに展開し、その場合でもアーカイブはプレーンよりも安価です。 モデルの選択が指示と同じくらい重要です。同一の指示は、gemmaの記録を40%、Qwenの記録を49%それぞれ自身のメーターで圧縮します — 圧縮性は測定可能な、モデルごとの特性であり、スケールではその差は実際の金銭です。電信テストは、モデルがこの種の圧縮にどれだけ優れているかを判断する方法です。 おそらく壁で囲むことはできません。レジスタはテストされたすべてのファミリーのトレーニングデータに存在します。フロンティアモデルでそれを抑制するラボは、まだそれを運ぶオープンモデルに優位性を移すだけです。 監査可能性は圧縮を生き延びます。エマージェントエージェントプロトコルとは異なり、電信体は人間が読め、慣習によって固定され、オンデマンドでデコード可能です — トークンは監査証跡を失うことなく縮小します。 電信時代、すべての単語がメーターで計測されていた時代 1866年、新しい大西洋横断ケーブルでメッセージを送るのに10単語で100ドルかかりました4単語あたり10ドル、最低10単語、今日の価値で約2,600ドル。それは今日では大金であり、当時も真剣な大金でした。電信会社は単語ごとに料金を請求し、その価格構造から産業全体が生まれました。 グレート・イースタン号が最初の成功した大西洋ケーブルを敷設している様子(油絵、国立海洋博物館、パブリックドメイン)。単語あたり10ドルを請求したリンク — そして一世代の通信員に電信体を書くことを教えた。 2つの圧縮戦略が現れ、それらは2つの非常に異なる技術に対応します: コードブック。出版社は大規模な商業コード辞書を販売しました — Bentley's ABC Telegraphic Codeは、数千の単語を単一のコードワードにマッピングする、数千ページのビジネスフレーズ全体をマッピングしていました。 OTTER …は意味するかもしれません*蒸気船到着、貨物無事、残高送金。*企業は40単語の交渉を6単語のコード交換に削減できました。コードブックは置換技術です:メッセージは完全な散文で存在し、辞書がそのチャンクを名前変更します。 電信体。オペレーターと通信員は次のような書式を進化させました:「火曜日到着、資金持参、金曜日妻が出航することを確認。」この規律あるスタイルは単語を節約しましたが、意味を失うことはなく、媒体のコストから自然発生したものでした。 時間が経つにつれて、電話、ファックス、電子メールなどの新しい技術により、単語あたりのコストプレミアムが崩壊したため、この形式は衰退しました。電信体は、コストのメーター計測、またはメッセージを打ち出すのにかかる時間がいまだに負担である場所で生き残っています:160文字のSMSはまったく新しい短縮文化を生み出し;初期のTwitterも同様でした。 さて、何だと思いますか? トークンは再びメーターで計測される単語です LLM APIの請求書は電信の請求書です。トークンごとに支払います。 そこで、昔ながらの2つの戦略を最新のモデルに対して実行しました: コードブック:既存のテキストを取り、固定辞書からコードワードを置換する。 #結果:約10%の節約。ほとんどの散文は辞書形状ではなく、置換は著者がすでに書いた単語を削除できません — それはそれらを名前変更することしかできません。 電信体 モデルに「電信体で完全な記録を書け;冠詞とフィラーを削除しろ;短縮しろ;すべての事実、数字、固有名詞はそのまま — 大文字ではなく小文字で。」と指示する。 なぜこれがモデル間で機能するのか? レジスタはすでに重みに存在します — トレーニングデータのアーティファクトです。電信ケーブル、