科学・技術
誕生の瞬間:標本と記録
Born Twice: Specimen and Record at the Moment of Collection (tjid3.org)
要約
この記事は、生物標本の採集時にその場で記録を作成する「インディペンデントファイル(IF)」という新しいシステムを提案しています。IFは単一のHTMLドキュメントで、UUIDとQRコードを用いて標本、写真、採集者、場所、日付を紐付け、Darwin Core標準に準拠したデータを採集と同時に記録します。これにより、標本がコレクションに収まるまでの数ヶ月から数年かかるデータ統合プロセスを不要にし、データの信頼性と永続性を高めることを目指しています。
全文翻訳
誕生の瞬間:標本と記録
T.M. Jones, Ph.D. TJID3 Research, Baton Rouge, Louisiana · ORCID 0000-0001-7372-6345 · CC BY 4.0 · 2026
要旨
前提。知識がある場所、つまりフィールドで記録せよ。タトゥーのように、記録はあなたが行くすべての場所につき従い、最初にそれを保持していたものを凌駕するべきである。
方法と結果。
インディペンデントファイル(IF)は、採集時に証拠記録を開始する単一のHTMLドキュメントである。UUIDとQRコードは、植物がプレスに入る前に、標本、写真、採集者、場所、日付を一緒に結びつける。フィールド、検証、Darwin Coreマッピング、およびエクスポートルールはすべて1つの場所に存在する:構築によるセマンティクス。
IFは、インストール、アカウント、サーバー、ネットワークなしでブラウザで実行される。デモンストレーションでは、5分未満で文書化された証拠を作成した。
IFはラベルを印刷し、HTML、JSON、CSV、XLSXをエクスポートし、Symbiota、Specify、DiSSCoパッケージを書き込み、GitHubにプッシュする。持ち帰り用のバンドルは単独で読み取れ、IFにインポートバックできる。下流システムは、それを作成または保持するための条件になることなく、記録を受け取ることができる。コレクターが送信しない限り、何もデバイスから離れない。
結論。
証拠記録は、そのアイデンティティを維持するために、永続的なデジタルホームを必要としない。オープンフォーマット、検査可能なソース、および単一のホストポイントの欠如は、数十年の使用を示唆しているが、サービス寿命は測定されていない。目標は、採集キャリアに続くフィールドブックであり、それを開く次の人にも意味が通じることである。標本はコレクションに送られ、記録はコレクターに残ることができる。
1.はじめに
壊れた連鎖
標本標本は、付随する記録が信頼できる限り(Liu et al., 2022; Chen et al., 2022)、系統学、植物相、保全生物学、および気候研究の基盤となる。信頼は、誰が、どこで、いつ、どの名前で採集したかという由来から始まる。それらを剥ぎ取れば、台紙に貼られた標本は、かつてどこかに植物が存在したことを証明する。それは何もではないが、それに近い。
しかし、証拠情報は、標本がプレス、乾燥、冷凍、画像化、同定、データ入力の過程を経るにつれて、依然として断片的に集められている。その連鎖が閉じるのに数ヶ月または数年かかる(Bebber et al., 2010; pers. obs.)。各引き渡しは、省略、誤記、または逸脱の機会である。
私たちは、連鎖の終端にあるデータベースを改善するために何十年も費やし、すべてが知られている唯一の瞬間である採集イベントにはほとんど何も費やさなかった。
システムは、その瞬間に記録を開始し、識別子、フィールド、Darwin Coreマッピング(Wieczorek et al., 2012)、画像、検証、およびエクスポートルールを1つのファイルに保持する。
設計原則は、構築によるセマンティクスである:記録の構造と動作がその意味を運び、誰も後で複数のシステムにわたってそれを再構築する必要がない。
電話はすでに標本の写真を撮り、それが立っていた場所を記録し、構造化されたデータを保存し、記録を先に進めることができる。標本館は、再構築するのではなく、記録を受け取る。残りの仕事は、データレスキューではなく、受入である。
記録は遅すぎる
デジタル化は野心に欠けたことはない。大規模なプログラムは、何十年にもわたってコレクションのデータベース化、画像化、地理参照、および動員に費やしてきた(Bebber et al., 2010; Barkworth and Murrell, 2012; Brilhante et al., 2026)。国立自然史博物館は、540万枚の維管束植物のシートをすべて画像化したが、そのうち16%しかフィールド採集情報を持っていない(Le Bras et al., 2017)。GBIFを通じて提供される530万件の記録のうち、約2.5%が座標を運んでいる(MNHN and Chagnoux, 2025)。小規模な標本館は、資金、労働力、トレーニング、およびハードウェアが不足している(Harris and Marsico, 2017; Powell et al., 2021)。
問題は努力ではない。タイミングである:標本が計算記録に最初にいつ、どこで、誰によってなるか。
最近のツールは、真の創意工夫でバックログに取り組んでいる。VARPは標本画像からバーコードを回復する(Powell and Shaw, 2021)。pyzbarはPythonでバーコードとQRをデコードする(Hudson, 2022)。mvhはRでオープン画像から仮想標本館を構築する(Vasconcelos and Boyko, 2025)。HespiはOCR、HTR、およびマルチモーダルモデルでシートラベルを読む(Turnbull et al., 2025)。iNaturalistツールは観察からラベルを印刷する(Rockefeller, 2026)。
証拠のない観察は、標本を上回り、世界的なパターンを誤って表している(Daru and Rodriguez, 2023)。
それぞれが実際の問題を解決する。ほぼすべてが採集後、1つまたは2つの手渡しが遅れて開始される。
このギャップは、標本を分子リポジトリにまで追跡する。
GenBankの136万件の被子植物記録のうち、52.9%が標本証拠識別子を運んでいた(Nakazato and Jinbo, 2022)。Dendrobiumでは、31.6%の記録が原産国を与え、4.8%が採集者または評価者を指名した(Wu et al., 2021)。6つの動物属にわたるCOI記録の著者監査では、同じ穴が見つかった:証拠識別子、採集日、採集者、座標、および識別子(表4;手順は付録D;Carné et al., 2025も参照)。
シーケンスは誕生からデジタルである。その由来はそうではない。
これらすべてが、歴史的なコレクションを再構築することを主張するものではない。既存のバーコードはそのままにしておくことができる。シートに再ラベルを貼る必要はなく、機関データベースを置き換える必要もない(Heil et al., 2026)。その馬は厩舎から出てしまった。
有用な質問は、次に採集された標本に何が起こるかである。
ここでの答えは、記録が作成されたときにDarwin Core用語を割り当てることである。
エクスポートは、その後、宛先が必要とする形式でその記録を提示し、写真が埋め込まれるかリンクされる。
QRコードは、より完全な記録を指すか、最小限のDarwin Core記録自体を運ぶことができる。
いずれにしても、アイデンティティ、分類群、場所、日付、および時刻は、任意のサーバーまたはリンクよりも長く存続する。
その狭い意味では、記録はデジタルパラタイプ(Jones, 2025)に似ており、Thiele et al.(2023)が提案したシーケンスベースのタイプに類似しているが、4文字コードとそのIUPAC装飾は含まれていない。
ここではプレーンJSONである。
Symbiota(Gilbert et al., 2026; Gries et al., 2014)、Specify(Specify Collections Consortium, 2026)、GBIF、および他の多くのシステムが宛先として残る。
目標は、フィールドからそれらに供給し、情報が漏れ出す前にデータの堤防の穴を埋めることである。
2.材料と方法
2.1依存関係ゼロのプリミティブ
結果はインディペンデントファイル(IF)である:計算するドキュメント。
約750KBの単一のHTMLファイルに、インターフェイス、コード、スタイル、および記録ルールが含まれている。
外部ライブラリ、フレームワーク、パッケージ、ビルドステップ、または必要なサービスはない。
TiddlyWikiは2004年以来、単一のHTMLファイルとして出荷されている(Ruston, 2026)。
2025年のウェブページの平均重量は2.9MBだった(Barret et al., 2026)。
参照デプロイメントはCarexキー(セクション9)内に含まれているが、証拠は分類群データを必要としない。
付録Aは、ファイルが行うすべてのジョブをリストしている。
表1. 5つの生物多様性データシステムとIFのプライマリデータストア、取り込みパス、および出力フォーマット。
すべてが境界でDarwin Core ArchivesまたはJSONに収束する。
公開リポジトリおよびドキュメント(iDigBioを含む、2026年)からコンパイル、2026年9月。
システム | プライマリストア | 取り込みパス | フォーマットアウト | JSONを読む
---|---|---|---|---
Specify 7 | MySQL / MariaDB | データ入力およびコレクションスタッフによるバッチインポート | DwC-A | ✓︎
Symbiota | MySQL / MariaDB | データ入力、CSVまたはDwC-Aインポート | DwC-A; JSON API | ✓︎
iDigBio | PostgreSQL (JSONB) | 通常IPT経由でのDwC-Aのハーベスト | JSON API | ✓︎
GBIF | Hadoop (Avro / Parquet) | 通常IPT経由でのDwC-Aのクロール | JSON API; DwC-AおよびCSVダウンロード | ✓︎
DiSSCo | PostgreSQL (JSONB) | ソースシステムおよびアグリゲーターからのマッピング | openDS JSON | ✓︎
IF | なし;単一HTMLファイル | コレクター、採集時 | JSON、CSV、XLSX;Specify、Symbiota、およびopenDSエクスポート | ✓︎
2-1a 2つのワークフロー:プレプリント対カウボーイメソッド
プレプリントはパフォーマンスの低下を防ぐ。
可能な限りラベルを持参せよ。
IFの印刷機能で、必要な数だけQRラベルを印刷せよ。
それらをプレス、フォルダー、または便利な場所に保管せよ。
未使用のラベルは使用可能のままである。
損傷した、濡れた、または破れたラベルを捨てよ;失うのは紙とインクだけである。
スキャンをヒットし、電話またはタブレットでそのラベルのQRコードをフレームせよ。
IFが識別子を採用する。
フィールドを記入せよ。
標本とその事前に印刷されたラベルをプレスに一緒に入れよ。
ラベルがない?
カウボーイメソッドで行け。
可能だが、推奨されない。
IFが生成するQRコードを使用せよ。
採集後...