科学・技術
複雑なシステムはいかにして失敗するか
How Complex Systems Fail (how.complexsystems.fail)
要約
複雑なシステムは本質的に危険であり、事故を防ぐために多くの防御層が構築されています。しかし、これらのシステムは常に多くの潜在的な欠陥を抱えており、個々の小さな失敗が連鎖することで、予期せぬ壊滅的な結果につながる可能性があります。事故の原因を単一の「根本原因」に帰することは誤りであり、実際には複数の要因が複合的に作用した結果であると論じています。
全文翻訳
複雑なシステムは本質的に危険なシステムです。
興味深いシステム(例:交通、医療、発電)はすべて、その性質上、本質的かつ避けがたいほど危険です。
危険への暴露の頻度は変更できる場合もありますが、システムに関わるプロセス自体は本質的かつ不可避的に危険です。
これらの危険が存在することが、これらのシステムを特徴づける危険に対する防御の創設を推進します。
複雑なシステムは、失敗に対して高度に、そして成功裏に防御されています。
失敗の高い結果は、時間とともに失敗に対する複数の防御層の構築につながります。
これらの防御には、明白な技術的コンポーネント(例:バックアップシステム、「安全」機能)と人的コンポーネント(例:トレーニング、知識)だけでなく、さまざまな組織的、制度的、規制的な防御(例:ポリシーと手順、認証、作業規則、チームトレーニング)も含まれます。
これらの対策の効果は、通常、運用を事故から遠ざける一連のシールドを提供することです。
壊滅的な事態は複数の失敗を必要とします – 単一点故障では不十分です。
防御の配列は機能します。
システム運用は一般的に成功します。
表面的で無害な小さな失敗が、システム的な事故の機会を作り出すために結合されると、表面的で壊滅的な失敗が発生します。
これらの小さな失敗のそれぞれは、壊滅的な事態を引き起こすために必要ですが、組み合わせだけが失敗を許容するのに十分です。
別の言い方をすれば、表面的で壊滅的なシステム事故よりも多くの失敗の機会が存在します。
ほとんどの初期の失敗軌道は、設計されたシステムの安全コンポーネントによってブロックされます。
運用レベルに到達する軌道は、ほとんどの場合、通常は実践者によってブロックされます。
複雑なシステムには、それらの中に潜在する失敗の混合物が変化し続けています。
これらのシステムの複雑さにより、複数の欠陥が存在しないまま実行することは不可能です。
これらは個別に失敗を引き起こすには不十分であるため、運用中はマイナーな要因と見なされます。
すべての潜在的な失敗の根絶は、主に経済的コストによって制限されますが、そのような失敗が事故にどのように寄与するかを事前に知ることが困難であるためでもあります。
技術、作業組織、および失敗根絶の努力の変化により、失敗は絶えず変化します。
複雑なシステムは、劣化したモードで実行されます。
前のポイントの推論として、複雑なシステムは壊れたシステムとして実行されます。
多くの冗長性を含み、人々が多くの欠陥が存在するにもかかわらず、それを機能させることができるため、システムは機能し続けます。
事故後のレビューでは、システムが壊滅的な事態をほぼ引き起こした過去の「プロト事故」の履歴を持っていることがほぼ常に指摘されています。
これらの劣化した状態が、表面的で壊滅的な事故の前に認識されるべきだったという議論は、通常、システムパフォーマンスに関する単純な考えに基づいています。
システム運用は動的であり、コンポーネント(組織的、人的、技術的)は継続的に失敗し、交換されています。
壊滅的な事態は常にすぐそこにあります。
複雑なシステムは、壊滅的な失敗の可能性を秘めています。
人間の実践者は、これらの潜在的な失敗に物理的および時間的に近い距離にほぼ常にいます – 災害はいつでも、ほとんどどこでも発生する可能性があります。
壊滅的な結果の可能性は、複雑なシステムの際立った特徴です。
このような壊滅的な失敗の可能性を排除することは不可能です。そのような失敗の可能性は、システムの性質上、常に存在します。
事故後の「根本原因」への帰属は根本的に間違っています。
表面的で壊滅的な失敗は複数の障害を必要とするため、事故の孤立した「原因」はありません。
事故には複数の寄与要因があります。
これらのそれぞれは、それ自体では事故を作成するには不十分です。
共同でなければ、これらの原因は事故を作成するには十分ではありません。
実際、事故に必要な状況を作成するのは、これらの原因をリンクすることです。
したがって、事故の「根本原因」の孤立は不可能です。
「根本原因」のような推論に基づく評価は、失敗の性質に関する技術的な理解を反映しているのではなく、結果に対して特定の、局所的な力や出来事を非難するという社会的、文化的ニーズを反映しています。
1 1人類学的なフィールドリサーチは、「原因」という概念の社会的構築の最も明確な実証を提供します(cf. Goldman L (1993), The Culture of Coincidence: accident and absolute liability in Huli, New York: Clarendon Press; および Tasca L (1990), The Social Construction of Human Error, Unpublished doctoral dissertation, Department of Sociology, State University of New York at Stonybrook)。
Hindsight bias(後知恵バイアス)は、事故後の人間のパフォーマンス評価に影響を与えます。
結果を知っていると、結果につながった出来事が、実際よりも当時実践者にとってより顕著に見えたように思われます。
これは、事故後の人間のパフォーマンスの事後分析が不正確であることを意味します。
結果の知識は、事故後の観察者が事故前の実践者の視点を、それらの同じ要因について再現する能力を損ないます。
実践者は、要因が「必然的に」事故につながることを「知っているべきだった」ように思われます。
2 Hindsight biasは、特に専門的な人間のパフォーマンスが関わる場合、事故調査における主要な障害であり続けます。
2 これは、医学的判断や技術的判断の特徴ではなく、過去の出来事とその原因に関するすべての人間の認知の特徴です。
人間のオペレーターは二重の役割を持っています:生産者として、そして失敗に対する防御者として。
システムの実践者は、望ましい製品を生産するためにシステムを運用し、事故を阻止するためにも働きます。
生産の要求と初期の失敗の可能性とのバランスをとる、システム運用のこの動的な性質は避けられません。
外部の人間は、この役割の二重性をめったに認めません。
事故のない時期には、生産の役割が強調されます。
事故の後には、失敗に対する防御の役割が強調されます。
どちらの時点でも、外部の視点は、両方の役割へのオペレーターの絶え間ない、同時的な関与を誤解しています。
すべての実践者の行動は賭けです。
事故の後、表面的で壊滅的な失敗はしばしば避けられなかったように見え、実践者の行動は過失または意図的な差し迫った失敗の無視と見なされます。
しかし、すべての実践者の行動は実際には賭け、つまり不確実な結果に直面して行われる行為です。
不確実性の程度は、瞬間ごとに変化する可能性があります。
実践者の行動が賭けであることは、事故の後には明らかに見えます。一般的に、事後分析ではこれらの賭けは悪いものと見なされます。
しかし、その逆:成功した結果も賭けの結果であること。は広く認識されていません。
最前線の行動がすべての曖昧さを解決します。
組織は、生産目標、リソースの効率的な使用、運用コスト、および低・高結果事故の許容リスクの関係について、しばしば意図的に曖昧です。
すべての曖昧さは、システムの最前線にいる実践者の行動によって解決されます。
事故の後、実践者の行動は「エラー」または「違反」と見なされるかもしれませんが、これらの評価は後知恵によって大きく偏っており、特に生産圧力などの他の推進力を無視しています。
人間の実践者は、複雑なシステムの適応可能な要素です。
実践者と第一線の管理者は、生産を最大化し、事故を最小化するためにシステムを積極的に適応させます。
これらの適応は、しばしば瞬間ごとに発生します。
これらの適応の一部には以下が含まれます:(1)脆弱な部分の失敗への暴露を減らすためにシステムを再構築する。(2)予想される高い需要の領域に重要なリソースを集中させる。(3)予想されるおよび予期しない障害からの撤退または回復のための経路を提供する。(4)生産の削減やその他の増加手段を可能にするために、システムパフォーマンスの変化を早期に検出するための手段を確立する。