HN 日本語サマリー

← 一覧へ戻る
科学・技術

AIを400年のアーカイブに向けたら、忘れられた隕石などが見つかった

I Pointed AI at 400 Years of Archives. It Found a Forgotten Meteorites and More (jessewaites.com)

36 pointsby piratebroadcast15 コメント

要約

ソフトウェアエンジニアがAIエージェントとワークフローを駆使し、400年分の歴史的記録を調査した事例を紹介。AIは、忘れられた隕石の報告、失われたサイの記録、記録されていない火山噴火などを発見し、歴史研究の新たな可能性を示唆しています。このプロジェクトは、AIによる大規模なデータ解析と、人間の判断による検証を組み合わせた「AI支援型リサーチ」の有効性を実証しました。

全文翻訳

AIを400年のアーカイブに向けたら、忘れられた隕石などが見つかった AIを使って数百万件の歴史的記録を調査し、忘れられた隕石の報告、失われたサイ3頭、記録されていない火山噴火などを発見した方法。 先週、2026年10月1日、歴史家のベンジャミン・ブリーンは、「Opus 5.5を使ってドードーの新しい目撃証言を発見する」という投稿を公開した。彼はAIを使って、オランダ東インド会社のデジタル化された記録を検索した。同社は香辛料貿易を支配し、1602年から1799年に負債で解散するまでアジア各地に港を運営していた。GLOBALISEというプロジェクトが、同社の数百万ページの手書き文書を検索可能なテキストに変換した。ブリーンは、それらの転写文をAIで検索し、1615年の船の航海日誌から、マダガスカルの船員が「多くの亀、ドードーを捕獲した」という記述を発見した。400年間、公然の秘密として存在していた絶滅したドードーの新しい目撃記録だ。私はこの記事を読み、すぐに「自分にもできる」と思った。歴史家だからではなく、AIエージェントを操り、エージェンティックなワークフローを作成することに非常に長けたソフトウェアエンジニアだからだ。ブリーンの投稿はインスピレーションとなり、私はそのアプローチを拡張したかった。多くの異なる歴史的謎を並行して検索でき、いくつかの異なるAIモデルを連携させて結果をフィルタリングし、煩雑で時間のかかる手作業の一部を自動化できると考えた。しかし、その魅力は技術的な挑戦を超えていた。知られていることに貢献することには、何か名誉なことがあると思う。ニッチな分野にデータポイントを1つ追加するだけでも、ささやかだが価値のある貢献になるように感じた。それを実現できたら、本当に素晴らしいだろうと思った。私は、小さくも高性能な自宅AIラボを起動し、作業に取り掛かった。 計画 私はまずAIの「ディープリサーチ」アシスタントに、「オンライン上に既に存在するデータで解決できそうな歴史的な疑問は何か?」と質問した。それは13の候補を挙げ、データの完全性とアクセス可能性、AIの助けになる度合い、既に誰かが行ったかどうか、そして最も重要なこととして、回答が元のページで確認できるかどうかでランク付けされた。最後の点は、聞こえる以上に重要だ。AIモデルは自信を持って間違えることがあるため、すべての主張は実際の文書、つまり実際の筆記の手紙や印刷された新聞のスキャンに行き着く必要があった。そして、誰でも参照して自分で読むことができるアーカイブ参照が必要だった。そのリストには、オランダ東インド会社のアーカイブにおける動物、誰も見つけたことのない1808年の巨大な火山噴火、古いオランダの新聞における体感地震、記録されていない隕石の落下、そして完全に消滅した船などが含まれていた。次に、AnthropicのAIツールであるClaude Codeと提携し、一緒にこのリサーチパイプラインを考案した。まず、読書材料となったのは、オランダ東インド会社アーカイブ(1600年代から1790年代までの435万ページ)、オランダ国立図書館のデジタル化された新聞、2世紀分のアメリカの新聞、そして念のためいくつかの船の航海日誌だった。もし私がオランダ東インド会社のページだけを自分で読むとしたら、1ページあたり2分、1日8時間、週5日働いても、約70年かかるだろう。それは新聞を読む前だ。私の自作AIラボは、12時間の夜間実行でアーカイブ全体を処理した。 古い文書の難点は、誰も同じスペルを二度と使わないことだ。手書きや古い印刷物は、テキスト認識からエラーだらけで出てくる。17世紀のオランダ語では、「サイ」を約15通りの異なる方法で綴っていた。単純なキーワード検索では、探しているもののほとんどを見逃してしまうだろう。その夜間実行は、私のグラフィックカードが、各文章をその意味の数学的な指紋に変えたものだった。オランダ東インド会社アーカイブだけで570万の文章だ。これにより、単語の使用だけでなく、文章が何について書かれているかを検索できるようになった。それでも、単一の検索で数万件のヒットが得られる可能性があり、人間、あるいは大きなAIモデルでさえ、手頃な価格で読むには多すぎた。代わりに、最初の読書は、Jevと呼ばれる小さくて速い「システムワン」意思決定モデルが行った。これは狭い質問にしか答えない。「これは本物の動物か?」「野生か?」「どこにいるか?」百万単語あたり数セントのコストだ。象に関する59,000件の言及を読ませるのに約3ドルかかった。このプロジェクトで私が最も誇りに思っている部分は、AIではなく私のアイデアだったことだ。Jevをフィルタリングメカニズムとして使用することを提案したとき、Claude CodeのFableモデルはまだシステムワン型意思決定モデルが何であるかを知らなかった。パイプラインを構築する前に、そのアイデアを説明する必要があった。このような研究のほとんどでは、ボトルネックは候補となる文章を一つずつ読み、どれが詳しく調べる価値があるかを決定する人間だ。安価で高速な審査員をその席に置くことで、初期スクリーニングが自動化され、私は最も強力な候補と調査の方向性に集中できるようになった。私が詳しく調べたページは、すでに機械読書の2回のラウンドを生き残っていた。Jevがフラグを立てたものだけが先に進んだ。より大きなモデルであるClaude Haikuが、それらの少数のページを詳しく読み、翻訳し、日付と場所を抽出した。その後、Claude Codeエージェントが各元の筆記ページのスキャンを開き、転写と元の文書を照合した。何か新しいと呼ぶ前に、私は専門家自身が使用するカタログと照合した。 このプロジェクトでAIがどのように使用されたかについての簡単な注記:私はプロセス全体を通して積極的に関与し、プロジェクト全体を通してAIを操縦した。私は調査を新しい質問や情報源に向けて導き、どの手がかりが追求する価値があるかを決定し、自分が無駄なことをしていると気づいたときに、先に進む必要があると判断した。システムは私ができない規模で検索と読書ができたが、次にどこへ行くか、いつ止まるかを決定するには、依然として私の判断が必要だった。これは完全に自律的な調査ではなく、AI支援型の研究だった。もう一つルールがあり、それは最も重要だった。何も見つけられない検索を信頼する前に、そこにあると既に知っているものを見つけられることを証明しなければならない。だから、何か新しいものを探しに行く前に、パイプラインはブリーンのドードー、1783年のラキ噴火、1815年のタンボラ、そして他の十数件の既知の出来事を見つけなければならなかった。それは、庭に自分の腕時計を埋めて金属探知機をテストするようなものだ。それがそこにあることを知っている。探知機が見つけられないなら、他の場所で本当の宝を探す前に、探知機の問題を修正する必要があることを知っている。これらの既知の歴史的出来事は、私の埋められた腕時計だった。それを見つけられることを確認してから、それが見つけられないことの失敗を真剣に受け止める方法だった。コントロールは合格し、私は本当の検索を開始した。その後すぐに、私のカスタムビルドAIリサーチパイプラインは、書いた書記官が片付けて以来、誰にも読まれていないかもしれないページを表面化させ始めた。何百年も人間の目に触れていないかもしれない物語だ。 隕石の歴史は忘却された プロジェクトの最初の本当の発見は、予期せぬ場所から来た。1812年にバタビア(現在のジャカルタ)で印刷された新聞だ。バタビアは、約2世紀にわたってオランダの東アジアにおける権力の中心であった現在のインドネシアの大きな島ジャワ島に位置しており、その新聞は、オランダではなくイギリスが島を支配していた数年間(1811〜1816年)に印刷されたものだ。1812年12月19日のJava Government Gazette(英語)は、8月26日のBombay Gazetteからの手紙を再版した。パンダルプル近郊に駐屯していたイギリス軍の将校が、故郷に宛てて書いた手紙には、「M大佐は、3日前の(8月6日)雷雲から落下した奇妙な石を所有している。重さは4ポンドほどだろう、その大きさにしては非常に重く、鉄分を多く含み、まるで火薬がその周りで爆発したかのような薄い黒い殻で覆われている」と書かれていた。雷は「約30秒間、銃剣の火のような音」として聞こえたという。その石は地面に1フィート(約30cm)ほど埋まった。