HN 日本語サマリー

← 一覧へ戻る
その他

Show HN: Kekoso – macOS向けのオンデバイス音声認識と文字起こし

Show HN: Kekoso – On-device dictation and transcription for macOS (kekoso.app)

4 pointsby a_chmerev2 コメント

要約

Kekosoは、macOS上で動作するプライベートな音声認識・文字起こしツールです。ホットキーを押すだけで任意のアプリに音声を直接入力でき、オーディオ・ビデオファイルやYouTubeリンクの文字起こしもローカルで行えます。会議の通話録音では、自分の声と相手の声が別々のトラックに記録・文字起こしされるため、誰が何を話したかが明確になります。また、ローカルで動作するAIエージェント(Claudeなど)と連携し、APIキー不要で利用できる機能も提供します。

全文翻訳

話すだけで、どのアプリにも ホットキーを押して、話せば、カーソルがある場所にテキストが表示されます — メール、Slack、Cursor、ブラウザのフォームなど。アプリごとの統合は不要で、切り替えるウィンドウもありません。 ファイルとリンク 声を持つものなら何でも オーディオまたはビデオファイルをドロップインするか、権利を持つYouTube動画のリンクを貼り付けてください。タイムスタンプ付きのクリーンなトランスクリプトが得られ、TXT、SRT、またはVTTとしてエクスポートできます。数時間の録音も、ご自身のマシンで処理されます。 通話 ボットがいない会議での通話 自分の側から録音すると、2つに分割されたトランスクリプトが得られます:あなたのマイクは1つのトラックに、他の全員はもう1つのトラックに。誰も会議にノートテイカーを認めさせる必要はなく、「誰が何を言ったか」は推測ではなく、録音のプロパティとなります。 エージェント ツール用の文字起こしサーバー Kekosoは8つのツールを備えたローカルMCPサーバーを実行します。Claude Code、Claude Desktop、Codexはこれを介して文字起こしを行い、語彙とモデルを管理します — APIキー不要、分単位の課金なし、誰かへの往復なし。 ほとんどの「プライベート」な音声認識アプリ 1. あなたのマイク デバイスでキャプチャされたオーディオ 2. 彼らのサーバー 認識のためにアップロード 3. 彼らのストレージ トランスクリプトが保持され、トレーニングに使用されることもあります ローカルで録音することと、ローカルで処理することは同じではありません。 Kekoso 1. あなたのマイク デバイスでキャプチャされたオーディオ 2. あなたのNeural Engine Mac上でモデルが実行 3. あなたのテキストフィールド テキストが挿入され、オーディオは破棄 アカウントなし、アップロードなし、差し押さえられるサーバーなし。 ファイルとリンク 3時間の録音を、コーヒーを淹れている間に文字起こし MP3、MOV、ボイスメモ、画面録画をドラッグ&ドロップしてください。または、権利を持つYouTube動画のリンクを貼り付けてください。その後すべてはMac上で行われます — アップロードなし、キューなし、分単位のメーターなし。 macOSが既に開くオーディオとビデオ:mp3、m4a、wav、aiff、ogg、opus、mp4、movなど。 使用権または許可を得ている素材のYouTubeリンク、または新しいファイルを自動的にキューに入れる監視フォルダ。 タイムスタンプ付きでTXT、SRT、VTTとしてエクスポート — またはFinderの「このアプリケーションで開く」からファイルを送信。 Macでオーディオとビデオを文字起こしする方法 YouTube動画からトランスクリプトを取得する 通話録音 誰が何を言ったか、なぜならそれは常に1つのトラックではなかったから 通話の前に録音を開始すると、Kekosoは2つのストリームをキャプチャします:あなたのマイクと、相手がスピーカーに送信するすべて。両方とも個別に文字起こしされ、1つのタイムラインにマージされるため、「あなた」と「その他」は、後で推測されたものではなく、録音の事実となります。 ボットは通話に参加せず、誰も承認する必要はありません。 スピーカーからのエコーは減算されるため、あなたの側が二重にならない。 トランスクリプトは話者ラベル付きでエクスポートされます — 要約のためにエージェントに渡してください。 エージェント ClaudeやCodexに耳を与える Kekosoはローカルソケット上でMCPサーバーを実行します。ワンクリックでClaude Code、Claude Desktop、またはCodex / ChatGPTデスクトップにインストールでき、文字起こしはエージェントが実行できるものになります — リークするAPIキーなし、分単位の請求なし、オーディオがマシンから離れることはありません。 8つのツール:ファイルまたはYouTubeリンクを文字起こし、語彙を読み取り編集、モデルをリスト、インストール、削除する。 削除にはKekosoでのクリックが必要です — エージェントは要求できますが、削除はできません。 すべての通話は読み取り可能なジャーナルに記録され、サーバー全体には1つのオフスイッチがあります。 語彙 あなただけが使う単語を教える クライアント名、薬の名前、社内略語、誰も正しくスペルできないライブラリ。単語を一度追加すれば、それ以降のすべてのトランスクリプトで、音声認識、ファイル、通話、エージェントの通話すべてで、あなたの方法で書き込まれます。 2種類のルール:既に聞いている単語のスペルを修正するか、1つの単語を別の単語に置き換える。 既に保持しているリストをインポート — CSV、エンコーディング、セパレーターが検出されます。 これは英語だけでなく、すべての言語に適用されます。 モデル トレードオフを自分で選択する 3つのファミリーから5つのモデルが、オンデマンドでダウンロードされ、アプリバンドルの外に保持されます。各カードには、同じベンチマークで測定された精度と速度が表示されるため、「高速」と「高精度」は、私たちが選んだ形容詞ではなく、あなたが比較する数値です。 速度のためのParakeet、リーチのためのWhisper — 99言語、CJKのためのSenseVoice。 各カードには、単語エラー率とリアルタイム係数が表示され、注意点も明記されています。 モデルごとに認識言語を設定するか、Autoに設定します。 Macでの音声認識:4つの方法を比較 2026年のMac向け音声認識アプリのベスト あなたの週を数える あなたが実際に話す量 話した単語数、話した回数、話す速度を、今日、今週、今月、またはすべてについて表示します。続けた日と続かなかった日の棒グラフ付き。 何も失われない すべてのトランスクリプトは、まだあなたのMac上にあります。 各音声認識は、入力されたアプリと共に保存されます — ペーストに失敗したものも含め、あなたの言葉は間違ったウィンドウでも生き残ります。エントリを再度コピー、削除、または保持期間に従ってスケジュールでクリアさせることができます。