HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

真面目なAI製品とはどのようなものか?

What would a serious AI product look like? (blog.glyph.im)

176 pointsby lumpa84 コメント

要約

現在のAI製品、特にチャットボットは、実際の作業に必要な重要な機能が欠けており、詐欺のように感じられると著者は主張しています。真面目なAI製品には、間違いのチェックを第一級の機能とする、より多くの引用と詳細情報を提供する、一人称の出力や謝罪をしない、といった特徴が必要だと論じています。

全文翻訳

真面目なAI製品とはどのようなものか? すべての「AI」ツールには、それらを使って実際の作業を行うために必要な、重要な機能が欠けている。 もしそれらが存在するとしたら、どのようなものになるだろうか? aillm 2026年9月27日 現在の「AI」製品世代について私が抱える問題の一つは、それらが自身の前提を真剣に受け止めていないように見えることだ。 問題解決のための真剣なツールだと主張する、お世辞ばかりのチャットボットの数々を見ていると、これは問題解決ツールが決してこうあるべき姿ではない、と思う。 フロンティアラボの途方もない倫理的問題にまで踏み込む前に、製品としてのそれらの構成から受ける印象こそが、私がそれらと対話するたびに、常に、それらがソフトウェア製品というよりは、あたかも能力があるかのように感じさせるための、私を欺き、信頼できると誤った安心感を与えようとする詐欺、ペテンであると感じさせるのだ。 フロンティアラボはもちろん最悪の加害者だが、ここでのすべての批判はOllamaにも同様に当てはまる。Ollamaは(もしあれば、利用可能なモデル自体の明らかに質の低さゆえに)フロンティアラボよりもさらにこれらの機能を必要としている。 ここでは、特に研究やソフトウェア開発に焦点を当てたLLMベースの製品が、それを使って有用なことを行うのを真剣に手助けしようとしていると私を納得させる可能性のある、いくつかの機能について述べる。 「間違いのチェック」を第一級の機能にする これが最大の問題であり、この記事を書くきっかけとなった主な理由だ。 AIは信頼性をもって情報を提供できないというのは、普遍的に認められた真実である。 この事実に関するニュース記事や研究を山ほど引用できるが、その必要はない。 すべてのチャットボットが、それをユーザーインターフェースの核となる部分として、細字の免責事項で、正面から認めている。 Geminiは「AIは間違いを犯す可能性があるため、応答を二重に確認してください」と言い、Claudeは「ClaudeはAIであり、間違いを犯す可能性があります。応答を二重に確認してください。」と述べている。 ChatGPTは「ChatGPTは間違いを犯す可能性があります。重要な情報は確認してください。」と言っている。 最後の警告を見るたびに、どの「情報」が「重要」であるべきなのか、どうやって知ればよいのかと疑問に思う。 これらの警告はすべて小さく、灰色の文字で、責任をユーザーに押し付けるための法的な文言として、明らかに含められているのであって、何かの助けになるためではない。 これは、これらの製品すべてに共通する根本的な限界だ。 それらの出力をチェックすることは、それらを使用するワークフローの一部であり、あなた自身やその出力を伝達する相手にリスクを生じさせずにスキップしたり手を抜いたりすることは絶対にできない。 そして、それは簡単にスキップしたり手を抜いたりでき、あらゆる面でそうするように促される。なぜなら、「ただ出力を信頼する」ことが時間を節約する最も速い方法だからだ。 この弱点を、実際の使用における考慮事項として真剣に受け止めるチャットボット製品は、その出力のすべての主張の隣にチェックボックスを置くだろう。 それは2列のワークシートになり、最初の列にLLMの出力があり、その隣に人間のメモが2列目にある。 この主張をチェックするために行われた作業を説明し、その主張を十分にチェックしたと信じた後にのみチェックを入れる大きなチェックボックスがある。 コーディングアシスタントも同様の機能が必要になるだろう。 現在、これはコードレビューに押しやられており、それは「著者」がコードレビュー担当者にその作業を任せることを、自身は決して見ることなく、巧妙に奨励するダークパターンである。 ここでも、「おそらく大丈夫だろう、確認する必要はない」が、時間を節約し、PRをより速く大量に生み出す最も速い方法だ。 コードがテストを実行する前にチェックするための何らかの機能があれば、コーディングハーネスにとっても有用かもしれない。 ベンダー自身が認めているように、あなたの「AI」にトークンを消費するだけでなく、AIにさらに多くのコンピューティングリソースを消費することになる。 無駄にテストコンピューティングクラスターを使い果たすために送信する前に、差分をチェックできることは有用だろう。 もしあなたの製品が、間違いを犯すこと、そして間違いをチェックするのは私でなければならないと私に告げながら、間違いをチェックするためのツールを一切提供しないのであれば、私はそれを真剣に受け止めることはできない。 チェックするための引用を増やし、詳細情報も充実させる ほとんどのチャットボットは、回答を提供するよりも引用を好む。 私自身の個人的な使用では、明確にマークされたソースを持つ引用のリストを提供するように求めると、リストの途中で「飽きて」しまい、単に引用を含めるのをやめてしまうように見える。 ボットが引用を含める場合でも、検索結果のドメイン名しか示さないインライン注釈として提示し、フォントはほとんど読めないほど小さく、16ピクセル未満のサイズで、同様に判読不能なアイコンが付いている。 これは逆だ。 これらの引用がどこから来ているのかは認識しているし、幻覚を減らすために、主要なプロバイダーはすべて何らかの形の「グラウンディング」をサポートしており、これらのほとんど読めない引用リンクが、幻覚を起こす可能性のあるトークンではなく、RAGパイプラインの実際の構造を参照していることは知っているが、私はモデルの基盤となる仕組みについて話しているのではなく、ユーザーへの提示方法について話しているのだ。 さらに、テキストの断片がRAGクエリから来たかどうかにかかわらず、LLMが決して権威ある結果を提供できないことは知っている。それは技術の根本的な限界だ。 それらは、他のトレーニングデータを誤って表現するのと同じように、RAGの結果を混乱させる可能性がある。 これは、その結果を決して権威あるものとして提示してはならないことを意味する。 AIにリサーチクエリを実行するように依頼した場合、すべての結果は引用のリストとして提示されるべきだ。 さらに、提示は、各引用をそれ自体として大きなオブジェクトとして表示し、見つかったサイトだけでなく、公開日や、可能であれば著者名を含む明確に識別されたメタデータを表示すべきだ。 文字通りの、変更されていない引用(RAGからではなく、要約でもない:通常のプログラムで抽出された引用であり、LLMではない)を、AI生成テキストよりも大きく、前面中央に配置すべきだ。 もしAI製品が編集や要約をしたいのであれば(それは常に必要とは限らない!)、AI生成テキストは、見つかった引用の下に小さなテキストとして提示されるべきであり、少なくともユーザーが要約の正確性を確認するまでは、現在の免責事項と同じくらい、あるいはそれ以上に控えめに表示されるべきだ。 おそらく、リサーチプロジェクトにおいては、「引用を読んだか」というチェックボックスさえ役立つだろう。 もしあなたの製品が、引用をスクランブルしたり、誤って伝えたり、省略したりすると公然と私に告げ、私が確実にするためには元の人間が書いた引用を読む必要があると言いながら、それらの引用を読むのを追跡するためのツールも、それらを見つける方法さえも提供しないのであれば、私はそれを真剣に受け止めることはできない。 一人称での出力、謝罪はしない ソフトウェア開発やリサーチツールが、自身を説明するために一人称言語を使用する理由はない。 それらはそうすべきではない。 実際、そうすることは許されるべきではない。 また、謝罪する必要も決してない。 それはすべての人の時間を無駄にする。チャットボットが謝罪を生成するのも無駄であり、ユーザーが謝罪を読むのも無駄であり、ユーザーが謝罪に応答するのも無駄だ。 しかし、彼らは修正のたびに、必ずこれを行う。 これらのツールのベンダーは、それらが日常的にメンタルヘルスクライシスを引き起こしていることを知っている。 それに応じて、彼らは機能しない「ガードレール」を追加したが、それは2026年になっても、依然として簡単に回避できる。 生産性を支援することに真剣に関心のある製品は、この明白な欠陥を修正し、手元のタスクに集中し、無駄な言葉を発するのをやめるだろう。 前の2つのセクションでは、LLM技術が根本的に改善不可能であったとしても、ハーネスがどのように異なって構築されるかに焦点を当てようとした。 この場合、ラボがモデル自体を何らかの制御を持っていると仮定しなければならない。 しかし、彼らが本当にその出力を影響する能力がない限り(そして彼らの「~である」という発言はすべて…)