HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Show HN: 18万語がテンポラル知識グラフとしてどのように見えるか (Ozシリーズ)

Show HN: What 180k words look like as a temporal knowledge graph (Oz series) (synaptale.com)

8 pointsby ald0r0 コメント

要約

この記事は、物語をエンティティ(ノード)とそれらの関係や行動(エッジ)で構成されるテンポラル知識グラフとしてモデル化するSynapTaleというシステムを紹介しています。デモではOzシリーズの最初の100章を使用しており、キャラクターの行動、秘密、人間関係などの興味深い分析結果が示されています。システムは、LLMとNLPを組み合わせた複数のパイプライン、時間経過を考慮したエッジのタイプ分け、物語固有のオントロジー構築、そしてエピステミックノードによる情報伝達の表現といった技術的アプローチを採用しています。

全文翻訳

グラフは自由に探索でき、登録は不要です。 SynapTaleは、ノード(エンティティ)とエッジ(それらの行動と関係)で構成されるテンポラルグラフとして物語のモデルを構築します。 グラフはウィキの可視化ではありません。ウィキ、タイムライン、関係履歴、分析はグラフの投影です。 現在のデモには232のエンティティ、1,852のエッジが含まれており、物語の状態のスナップショットが各章ごとに記録されています。第100章の時点でも、第8章で交わされた約束を記憶しており、物語をソース検証可能な事実のセットに変換します。 最も興味深いものは、グラフ自体と分析タブで見つけることができます。私が発見したいくつかのこと: 1. 最も多くの殺害数を持つキャラクターはブリキの木こりです。偶然踏み潰した甲虫を悼んで泣くキャラクターと同じです。ドロシーが3回の殺害イベントで2位です。 2. ドロシーはシリーズの最初の100章では誰一人欺いていません。 3. 臆病なライオンは、第8章から始まった92章の間、脅迫の数で3位です。 4. 臆病なライオンは脅迫の数で3位です。 5. 最初の100章には60の秘密と254の対話イベントが含まれています。 技術的な詳細 1. LLMとNLPを組み合わせた5種類のマルチエージェントパイプライン:プリスキャン、オントロジー構築、章ごとのグラフ抽出、数十章にわたる遡及的検証、および音声プロファイルと言語エッジのための言語プリスキャン。 2. 生きている物語には、生きているグラフが必要です。それは時間を考慮しなければなりません。なぜなら、エンティティとその間の関係は進化するからです。単純なis_activeフィールドだけでは不十分です。 私は3種類のエッジに行き着きました。 イベント:瞬間的な行動。 アイデンティティ:事実。 ステート:終了に正当化とテキストからの引用を必要とする永続的な行動。 エッジの大部分はイベントであり、開始したのと同じ章で終了します。これにより、ステートおよびアイデンティティのエッジの少数のみが継続的にアクティブであるため、システムはうまくスケールします。 3. オントロジー。LLMにエンティティと関係をグラフに抽出するように単純に依頼することはできません。各章で、最も賢いモデルでさえ、重要でないフィールドを発明し続け、既存のフィールドの新しいエイリアスを作成し、同じフィールドを一貫性のない方法で表現します。 したがって、グラフを抽出する前に、システムは物語全体にわたってオントロジーのスキャンを実行します。それは、物語固有のエンティティとエッジのタイプ、およびそれらのフィールドと説明をキャプチャします。 4. エピステミクス。イベントは物語の一部にすぎません。情報の分布を理解することも重要ですが、イベントエッジだけでは表現するのが難しいです。 私はこれを新しいノードタイプであるエピステミックノードを導入することで対処しました。これは、異なるエンティティが同じ事実に対する視点をキャプチャします。微妙なヒントはまだ見逃される可能性があります。この分野ではシステムはまだ完璧ではありません。