HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

データフローモデルの再訪

The Dataflow Model Revisited (vldb.org)

4 pointsby scott_s1 コメント

要約

11年前に発表されたデータフローモデルに関する論文は、ストリーミングデータ処理におけるイベントタイムの重要性や、データの完全性を待たないアプローチの妥当性を再評価しています。論文では、当初のモデルの核となる考え方は概ね正しかったものの、ウィンドウ処理やトリガーといった分析インターフェースの設計、ストリームとテーブルの関係性の理解に課題があったことを認め、データベースの既存手法(SQL、増分ビューメンテナンスなど)から多くを学んだと述べています。

全文翻訳

11年前、データフローモデルに関する論文は、アンバウンドで順不同のデータが新しい標準であり、データが完全に揃うのを待つことをやめなければならないと主張しました。それは、バッチおよびストリーミングエンジン全体で、正しさ、レイテンシ、コストを自由にトレードオフするための統一モデル(ウィンドウ処理、トリガー、ウォーターマーク、リトラクション)を提案しました。 VLDB Test of Time賞受賞を機に、私たちは自身の仕事、すなわち実質的にはストリーミング分析に関する論文を、何がうまく機能し、何がうまくいかず、何を見落としたのかを評価します。 論文の核となる基盤は概ね健全であることがわかりました。イベントタイムの優位性、完全性を待つことの無益さ、そして強い整合性へのこだわりは、うまく機能しました。 しかし、分析インターフェースの重要な部分を誤解していました。(1) ウィンドウ処理とトリガーは、その意味論が運用上の懸念と絡み合っていたため、本来よりも過度に説明の中心となってしまいました。(2) トリガーは、ユーザーが決して直面すべきではなかった問題に対する、過剰に設計された回答でした。(3) ストリーム中心の世界観は、より深い真実を見落としていました。すなわち、ストリームとテーブルは、異なるアクセス意味論を持つ同じオブジェクトの2つの表現であるということです。 論文の分析目標を達成したメカニズムは、最終的にデータベースのプレイブックから進化しました。SQL、増分ビューメンテナンス、そして明示的な鮮度契約を持つマテリアライズドビューです。私たちは、ストリーミングのメカニズムに注力しすぎ、データベースコミュニティが開始したが完了しなかったこと、すなわち分析ストリーミングの複雑さをほぼ完全に消し去ることを終えませんでした。 それでも、その評価はすべて告白ではありません。完全性の原則が2つの成功した形態に分かれたことを探求します。ウォーターマーク(ストリームが可視のまま)とスナップショット整合性リフレッシュ(ストリームが可視でない場合)です。後者が、前者よりもはるかに少ない要求で、より多くのユーザーに到達した理由を追跡し、前者を変更に対する宣言された制約に一般化します。 また、(1) バッチ対ストリーミングの議論はほとんど意味論的なものであったこと、(2) 低レイテンシの需要が古いOLTP/OLAPの線に沿って二分され、分析はより穏やかな鮮度で満足していること、(3) 私たちが始めたかったフレームワーク(残す、除外する、より強くプッシュする)を採用したこと、(4) 分析を超えたストリーミングの最終的な消滅を考察します。 PVLDBはVLDB Endowment Inc.の一部です。プライバシーポリシー