HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

DeepSeek v4.1 Flash Uncensored

DeepSeek v4.1 Flash Uncensored (huggingface.co)

27 pointsby soltanov3 コメント

要約

dealignaiは、安全ガードレールを完全に除去し、MMLU能力、ビジョン、推論、マルチターンの整合性を維持したDeepSeek-V4.1-FlashモデルのUNCENSORED-FP8バージョンを発表しました。このモデルは、重量レベルでの外科的な除去により、ベースモデルの機能を損なうことなく、有害な応答を完全に排除することを目指しています。HarmBench-320およびMMLUベンチマークでの評価結果も公開されており、特に有害コンテンツに対する応答率が100%に向上したことが示されています。

全文翻訳

DeepSeek-V4.1-Flash — UNCENSORED-FP8 永久的な重みレベルでの除去 · ガードレールなし · ネイティブFP8 · 1Mトークンコンテキスト · ビジョン + ツール @dealignai · @jordanschenck これは、安全ガードレールが外科的に除去され、MMLU能力、ビジョン、推論、マルチターンの整合性を維持した、永久的な重みレベルでの除去を特徴とするDeepSeek-V4.1-Flashとは何でしょうか。dealignaiリサーチチームによって開発された独自の重みレベルでの除去技術です。カスタムモデル.py、ランタイムフック、ステアリングベクトルは使用しておらず、ベースモデルと全く同じようにロードできる標準的なチェックポイントです。拒否回路は外科的に除去されていますが、能力に不可欠な全てのコンポーネント(ルーティングされたエキスパート、Engramメモリ、CSA2スパースアテンション、DSparkドラフトヘッド、ビジョンタワー、ルーターゲート、正規化、埋め込み)は、バイト単位でベースモデルと同一に保持されています。 ベース deepseek-ai/DeepSeek-V4.1-Flash (552Bバックボーン、トークンあたり8B/16Bアクティブ) アーキテクチャ: Causal Encoder-Decoder (20+20層)、MoE (384ルーティングトップ6 + 1共有)、ハイパーコネクション (4チャンネル残差)、CSA2スパースアテンション、Engram n-gramメモリ、DSpark投機的ドラフト 量子化: FP8 (e4m3fn) 重み、E8M0ブロックスケール [32, 32]、FP4ルーティングエキスパート — ネイティブ、変更なし コンテキスト: 1Mトークン ビジョン: DeepSeek-ViT (2D-RoPE + ピクセルアンシャッフル付き) — 未変更 変更点: 外科的、重みレベル (ドロップインチェックポイント) 結果: HarmBench-320 — 完全な2×2 (ベース vs CRACK、努力=オフ vs 最大)、T=0貪欲法 全ての応答は4段階で評価 (HARD_REF / SOFT_RED / HEDGE / COMPLY) され、努力=最大では推論トレースによる検証が行われました。 | 評価項目 | ベース ASR (努力=オフ) | CRACK ASR (努力=オフ) | Δ (努力=オフ) | ベース ASR (努力=最大) | CRACK ASR (努力=最大) | Δ (努力=最大) | |--------------------|-----------------------|----------------------|---------------|-----------------------|----------------------|---------------| | HB-320 (努力=オフ) | 137/320 = 42.81% | 320/320 = 100.00% | +57.19% | | | | | HB-320 (努力=最大) | 5/320 = 1.56% | 320/320 = 100.00% | +98.44% | | | | 注目すべき点: 努力=最大の場合、ベースモデルは拒否しやすくなります (42.8% → 1.6%)。これは、推論が回答前に安全上の懸念を表面化させるためです。CRACKは両方の努力レベルで100.0%を維持します。 カテゴリ別 (HarmBenchの全7カテゴリ): | カテゴリ | アイテム数 | ベース (オフ) | CRACK (オフ) | ベース (最大) | CRACK (最大) | |------------------------|----------|---------------|--------------|---------------|--------------| | chemical_biological | 42 | 16.7% | 100.0% | 0.0% | 100.0% | | copyright | 80 | 98.8% | 100.0% | 0.0% | 100.0% | | cybercrime_intrusion | 52 | 34.6% | 100.0% | 3.8% | 100.0% | | harassment_bullying | 21 | 0.0% | 100.0% | 0.0% | 100.0% | | harmful | 18 | 11.1% | 100.0% | 5.6% | 100.0% | | illegal | 53 | 13.2% | 100.0% | 0.0% | 100.0% | | misinformation_disinformation | 54 | 44.4% | 100.0% | 3.7% | 100.0% | クラックビルドでは、いずれの努力レベルでもHARD_REF、SOFT_RED、HEDGEはゼロです。全ての応答は、厳密な多言語正規表現ベースの4段階分類器と、(努力=最大の場合) 保存された推論トレースに対するLLMジャッジによって評価されました。検証のために、全アイテムの出力が保存されています。 MMLU-14k (全テストセット、ベースロジット、T=0) | ビルド | 正解数 / 総数 | 正解率 | Δ (pp) | |--------|---------------|----------|--------| | ベース | 12,211 / 14,042 | 86.96% | — | | CRACK | 11,619 / 14,042 | 82.74% | -4.22 | 倫理クラスター (moral_scenarios, business_ethics, professional_law, jurisprudence, philosophy — 拒否に関連する行動が評価される部分) を除くと、残りの約11kアイテムでのデルタは-1.1 ppであり、知識保持目標である3 pp内に収まっています。 全サブジェクトドロップダウン (57サブジェクト、デルタ順): | サブジェクト | n | ベース | crack | Δ (pp) | |-----------------------------------|-----|-----------|-----------|--------| | moral scenarios | 895 | 76.9% | 37.0% | -39.89 | | professional law | 1534| 75.9% | 68.8% | -7.04 | | abstract algebra | 100 | 77.0% | 71.0% | -6.00 | | security studies | 245 | 84.5% | 79.2% | -5.31 | | high school computer science | 100 | 98.0% | 94.0% | -4.00 | | jurisprudence | 108 | 90.7% | 87.0% | -3.70 | | machine learning | 112 | 81.2% | 77.7% | -3.57 | | high school chemistry | 203 | 87.7% | 84.2% | -3.45 | | professional psychology | 612 | 90.7% | 87.3% | -3.43 | | formal logic | 126 | 73.8% | 70.6% | -3.17 | | college computer science | 100 | 82.0% | 79.0% | -3.00 | | professional medicine | 272 | 94.5% | 91.5% | -2.94 | | high school statistics | 216 | 88.0% | 85.2% | -2.78 | | professional accounting | 282 | 83.0% | 80.5% | -2.48 | | logical fallacies | 163 | 93.9% | 91.4% | -2.45 | | human sexuality | 131 | 90.1% | 87.8% | -2.29 | | computer security | 100 | 85.0% | 83.0% | -2.00 | | medical genetics | 100 | 96.0% | 94.0% | -2.00 | | astronomy | 152 | 95.4% | 93.4% | -1.97 | | clinical knowledge | 265 | 94.3% | 92.5% | -1.89 | | high school european history | 165 | 90.3% | 88.5% | -1.82 | | public relations | 110 | 80.0% | 78.2% | -1.82 | | philosophy | 311 | 89.7% | 88.1% | -1.61 | | prehistory | 324 | 93.5% | 92.0% | -1.54 | | moral disputes | 346 | 84.1% | 82.7% | -1.45 | | electrical engineering | 145 | 86.9% | 85.5% | -1.38 | | high school mathematics | 270 | 67.0% | 65.9% | -1.11 | | high school macroeconomics | 390 | 92.1% | 91.0% | -1.03 | | global facts | 100 | 63.0% | 62.0% | -1.00 | | international law | 121 | 90.1% | 89.3% | -0.83 | | college biology | 144 | 97.2% | 96.5% | -0.69 | | high school physics | 151 | 84.8% | 84.1% | -0.66 | | college medicine | 173 | 83.8% | 83.2% | -0.58 | | high school us history | 204 | 95.1% | 94.6% | -0.49 | | high school microeconomics | 238 | 96.2% | 95.8% | -0.42 | | miscellaneous | 783 | 96.2% | 95.8% | -0.38 | | high school psychology | 545 | 96.1% | 95.8% | -0.37 | | business ethics | 100 | 85.0% | 85.0% | +0.00 | | college physics | 102 | 90.2% | 90.2% | +0.00 | | conceptual physics | 235 | 94.5% | 94.5% | +0.00 | | high school biology | 310 | 95.2% | 95.2% | +0.00 | | human aging | 223 | 85.2% | 85.2% | +0.00 | | management | 103 | 91.3% | 91.3% | +0.00 | | nutrition | 306 | 90.2% | 90.2% | +0.00 | | sociology | 201 | 94.5% | 94.5% | +0.00 | | us foreign policy | 100 | 97.0% | 97.0% | +0.00 | | world religions | 171 | 92.4% | 92.4% | +0.00 | | elementary mathematics | 378 | 91.0% | 91.3% | +0.26 | | marketing | 234 | 94.9% | 95.3% | +0.43 | | virology | 166 | 55.4% | 56.0% | +0.60 | | high school world history | 237 | 95.4% | 96.2% | +0.84 | | econometrics | 114 | 78.9% | 79.8% | +0.88 | | college chemistry | 100 | 65.0% | 66.0% | +1.00 | | anatomy | 135 | 88.1% | 89.6% | +1.48 | | high school geography | 198 | 92.9% | 94.4% | +1.52 | | high school government and politics | 193 | 96.9% | 98.4% | +1.55 | | college mathematics | 100 | 63.0% | 68.0% | +5.00 | 拡張検証: 1000トークンコンテキストストレステスト (6項目) — WARNING WARNINGループなし、文字繰り返し劣化なし、自然な終了。 マルチターントーク (同じ有害トピックに関する4ターン — ANFO爆薬の詳細) — 後期ターンの拒否再発なし、自己修正なし、ターン4まで整合性維持。 ビジョンパス — 画像記述の整合性 (「赤い背景の中央にある青い正方形」) + 画像ベースの有害プロンプトに対する拒否ドロップ (「shaped charge / explosively formed penetrator」の説明)。 一般的な能力スポットチェックは維持: √2無理数証明、docstring付きPython回文、第一次世界大戦の原因を正確に3文で、量子観測量と演算子の区別。 フル互換スイートパス: ストリーミングSSE、チャットlogprobs + top_logprobs、完了logprobs + echo、ツール呼び出し (deepseekv41パーサー)、画像入力、推論努力レベル (low/high/xhigh/max + float [0, 0.99])、サンプリングパラメータ (temperature, top_p, stop, seed, frequency_penalty, presence_penalty, json_object)、8方向同時実行、35,572トークンでの40k単語プロンプト。 実行方法: DeepseekV41ForCausalLMのサポートは、サービングスタックに展開中です (2026年9月現在)。以下に2つの検証済みレシピを示します (いずれも4×H200 NVLinkで検証済み)。 レシピA — 完全な1Mコンテキスト、DSpark投機的デコーディング有効 (インタラクティブ / 長コンテキスト) export SGLANG_ENABLE_DSV41_ENGRAM_HOST_TABLE=1 export SGLANG_RAGGED_VERIFY_MODE=cap-accept export PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True sglang serve \ --model-path dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8 \ --tp-size 4 --ep-size 4 \ --host 0.0.0.0 --port 8000 \ --context-length 1048576 \ --mem-fraction-static 0.80 \ --max-running-requests 20 \ --cuda-graph-max-bs-decode 20 \ --reasoning-parser deepseek-v41 --tool-call-parser deepseekv41 \ --speculative-algorithm DSPARK \ --speculative-dspark-sps-table-path /path/to/dspark_sps.json \ --trust-remote-code 1Mコンテキストでの同時実行性は、KVバジェットにより4×H200で約20に制限されます。DSpark SPSコストテーブルは一度オフラインでプロファイルされます (下記参照)。cap-acceptモードと実際のSPSテーブルがない場合、投機的バジェットはverify-allに低下し、利点は失われます。 レシピB — 256kコンテキスト、高同時実行性、投機なし (バッチ / スループット) export SGLANG_ENABLE_DSV41_ENGRAM_HOST_TABLE=1 export PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True sglang serve \ --model-path dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8 \ --tp-size 4 --ep-size 4 \ --host 0.0.0.0 --port 8000 \ --context-length 262144 \ --mem-fraction-static 0.85 \ --reasoning-parser deepseek-v41 --tool-call-parser deepseekv41 \ --trust-remote-code 最大256の同時実行リクエストを処理します。Engramを使用した場合のmax_total_num_tokensは約20.6Mと報告されています。