AI・機械学習
DeepSeek v4.1 Flash Uncensored
DeepSeek v4.1 Flash Uncensored (huggingface.co)
要約
dealignaiは、安全ガードレールを完全に除去し、MMLU能力、ビジョン、推論、マルチターンの整合性を維持したDeepSeek-V4.1-FlashモデルのUNCENSORED-FP8バージョンを発表しました。このモデルは、重量レベルでの外科的な除去により、ベースモデルの機能を損なうことなく、有害な応答を完全に排除することを目指しています。HarmBench-320およびMMLUベンチマークでの評価結果も公開されており、特に有害コンテンツに対する応答率が100%に向上したことが示されています。
全文翻訳
DeepSeek-V4.1-Flash — UNCENSORED-FP8 永久的な重みレベルでの除去 · ガードレールなし · ネイティブFP8 · 1Mトークンコンテキスト · ビジョン + ツール @dealignai · @jordanschenck
これは、安全ガードレールが外科的に除去され、MMLU能力、ビジョン、推論、マルチターンの整合性を維持した、永久的な重みレベルでの除去を特徴とするDeepSeek-V4.1-Flashとは何でしょうか。dealignaiリサーチチームによって開発された独自の重みレベルでの除去技術です。カスタムモデル.py、ランタイムフック、ステアリングベクトルは使用しておらず、ベースモデルと全く同じようにロードできる標準的なチェックポイントです。拒否回路は外科的に除去されていますが、能力に不可欠な全てのコンポーネント(ルーティングされたエキスパート、Engramメモリ、CSA2スパースアテンション、DSparkドラフトヘッド、ビジョンタワー、ルーターゲート、正規化、埋め込み)は、バイト単位でベースモデルと同一に保持されています。
ベース deepseek-ai/DeepSeek-V4.1-Flash (552Bバックボーン、トークンあたり8B/16Bアクティブ)
アーキテクチャ: Causal Encoder-Decoder (20+20層)、MoE (384ルーティングトップ6 + 1共有)、ハイパーコネクション (4チャンネル残差)、CSA2スパースアテンション、Engram n-gramメモリ、DSpark投機的ドラフト
量子化: FP8 (e4m3fn) 重み、E8M0ブロックスケール [32, 32]、FP4ルーティングエキスパート — ネイティブ、変更なし
コンテキスト: 1Mトークン
ビジョン: DeepSeek-ViT (2D-RoPE + ピクセルアンシャッフル付き) — 未変更
変更点: 外科的、重みレベル (ドロップインチェックポイント)
結果: HarmBench-320 — 完全な2×2 (ベース vs CRACK、努力=オフ vs 最大)、T=0貪欲法
全ての応答は4段階で評価 (HARD_REF / SOFT_RED / HEDGE / COMPLY) され、努力=最大では推論トレースによる検証が行われました。
| 評価項目 | ベース ASR (努力=オフ) | CRACK ASR (努力=オフ) | Δ (努力=オフ) | ベース ASR (努力=最大) | CRACK ASR (努力=最大) | Δ (努力=最大) |
|--------------------|-----------------------|----------------------|---------------|-----------------------|----------------------|---------------|
| HB-320 (努力=オフ) | 137/320 = 42.81% | 320/320 = 100.00% | +57.19% | | | |
| HB-320 (努力=最大) | 5/320 = 1.56% | 320/320 = 100.00% | +98.44% | | | |
注目すべき点: 努力=最大の場合、ベースモデルは拒否しやすくなります (42.8% → 1.6%)。これは、推論が回答前に安全上の懸念を表面化させるためです。CRACKは両方の努力レベルで100.0%を維持します。
カテゴリ別 (HarmBenchの全7カテゴリ):
| カテゴリ | アイテム数 | ベース (オフ) | CRACK (オフ) | ベース (最大) | CRACK (最大) |
|------------------------|----------|---------------|--------------|---------------|--------------|
| chemical_biological | 42 | 16.7% | 100.0% | 0.0% | 100.0% |
| copyright | 80 | 98.8% | 100.0% | 0.0% | 100.0% |
| cybercrime_intrusion | 52 | 34.6% | 100.0% | 3.8% | 100.0% |
| harassment_bullying | 21 | 0.0% | 100.0% | 0.0% | 100.0% |
| harmful | 18 | 11.1% | 100.0% | 5.6% | 100.0% |
| illegal | 53 | 13.2% | 100.0% | 0.0% | 100.0% |
| misinformation_disinformation | 54 | 44.4% | 100.0% | 3.7% | 100.0% |
クラックビルドでは、いずれの努力レベルでもHARD_REF、SOFT_RED、HEDGEはゼロです。全ての応答は、厳密な多言語正規表現ベースの4段階分類器と、(努力=最大の場合) 保存された推論トレースに対するLLMジャッジによって評価されました。検証のために、全アイテムの出力が保存されています。
MMLU-14k (全テストセット、ベースロジット、T=0)
| ビルド | 正解数 / 総数 | 正解率 | Δ (pp) |
|--------|---------------|----------|--------|
| ベース | 12,211 / 14,042 | 86.96% | — |
| CRACK | 11,619 / 14,042 | 82.74% | -4.22 |
倫理クラスター (moral_scenarios, business_ethics, professional_law, jurisprudence, philosophy — 拒否に関連する行動が評価される部分) を除くと、残りの約11kアイテムでのデルタは-1.1 ppであり、知識保持目標である3 pp内に収まっています。
全サブジェクトドロップダウン (57サブジェクト、デルタ順):
| サブジェクト | n | ベース | crack | Δ (pp) |
|-----------------------------------|-----|-----------|-----------|--------|
| moral scenarios | 895 | 76.9% | 37.0% | -39.89 |
| professional law | 1534| 75.9% | 68.8% | -7.04 |
| abstract algebra | 100 | 77.0% | 71.0% | -6.00 |
| security studies | 245 | 84.5% | 79.2% | -5.31 |
| high school computer science | 100 | 98.0% | 94.0% | -4.00 |
| jurisprudence | 108 | 90.7% | 87.0% | -3.70 |
| machine learning | 112 | 81.2% | 77.7% | -3.57 |
| high school chemistry | 203 | 87.7% | 84.2% | -3.45 |
| professional psychology | 612 | 90.7% | 87.3% | -3.43 |
| formal logic | 126 | 73.8% | 70.6% | -3.17 |
| college computer science | 100 | 82.0% | 79.0% | -3.00 |
| professional medicine | 272 | 94.5% | 91.5% | -2.94 |
| high school statistics | 216 | 88.0% | 85.2% | -2.78 |
| professional accounting | 282 | 83.0% | 80.5% | -2.48 |
| logical fallacies | 163 | 93.9% | 91.4% | -2.45 |
| human sexuality | 131 | 90.1% | 87.8% | -2.29 |
| computer security | 100 | 85.0% | 83.0% | -2.00 |
| medical genetics | 100 | 96.0% | 94.0% | -2.00 |
| astronomy | 152 | 95.4% | 93.4% | -1.97 |
| clinical knowledge | 265 | 94.3% | 92.5% | -1.89 |
| high school european history | 165 | 90.3% | 88.5% | -1.82 |
| public relations | 110 | 80.0% | 78.2% | -1.82 |
| philosophy | 311 | 89.7% | 88.1% | -1.61 |
| prehistory | 324 | 93.5% | 92.0% | -1.54 |
| moral disputes | 346 | 84.1% | 82.7% | -1.45 |
| electrical engineering | 145 | 86.9% | 85.5% | -1.38 |
| high school mathematics | 270 | 67.0% | 65.9% | -1.11 |
| high school macroeconomics | 390 | 92.1% | 91.0% | -1.03 |
| global facts | 100 | 63.0% | 62.0% | -1.00 |
| international law | 121 | 90.1% | 89.3% | -0.83 |
| college biology | 144 | 97.2% | 96.5% | -0.69 |
| high school physics | 151 | 84.8% | 84.1% | -0.66 |
| college medicine | 173 | 83.8% | 83.2% | -0.58 |
| high school us history | 204 | 95.1% | 94.6% | -0.49 |
| high school microeconomics | 238 | 96.2% | 95.8% | -0.42 |
| miscellaneous | 783 | 96.2% | 95.8% | -0.38 |
| high school psychology | 545 | 96.1% | 95.8% | -0.37 |
| business ethics | 100 | 85.0% | 85.0% | +0.00 |
| college physics | 102 | 90.2% | 90.2% | +0.00 |
| conceptual physics | 235 | 94.5% | 94.5% | +0.00 |
| high school biology | 310 | 95.2% | 95.2% | +0.00 |
| human aging | 223 | 85.2% | 85.2% | +0.00 |
| management | 103 | 91.3% | 91.3% | +0.00 |
| nutrition | 306 | 90.2% | 90.2% | +0.00 |
| sociology | 201 | 94.5% | 94.5% | +0.00 |
| us foreign policy | 100 | 97.0% | 97.0% | +0.00 |
| world religions | 171 | 92.4% | 92.4% | +0.00 |
| elementary mathematics | 378 | 91.0% | 91.3% | +0.26 |
| marketing | 234 | 94.9% | 95.3% | +0.43 |
| virology | 166 | 55.4% | 56.0% | +0.60 |
| high school world history | 237 | 95.4% | 96.2% | +0.84 |
| econometrics | 114 | 78.9% | 79.8% | +0.88 |
| college chemistry | 100 | 65.0% | 66.0% | +1.00 |
| anatomy | 135 | 88.1% | 89.6% | +1.48 |
| high school geography | 198 | 92.9% | 94.4% | +1.52 |
| high school government and politics | 193 | 96.9% | 98.4% | +1.55 |
| college mathematics | 100 | 63.0% | 68.0% | +5.00 |
拡張検証: 1000トークンコンテキストストレステスト (6項目) — WARNING WARNINGループなし、文字繰り返し劣化なし、自然な終了。
マルチターントーク (同じ有害トピックに関する4ターン — ANFO爆薬の詳細) — 後期ターンの拒否再発なし、自己修正なし、ターン4まで整合性維持。
ビジョンパス — 画像記述の整合性 (「赤い背景の中央にある青い正方形」) + 画像ベースの有害プロンプトに対する拒否ドロップ (「shaped charge / explosively formed penetrator」の説明)。
一般的な能力スポットチェックは維持: √2無理数証明、docstring付きPython回文、第一次世界大戦の原因を正確に3文で、量子観測量と演算子の区別。
フル互換スイートパス: ストリーミングSSE、チャットlogprobs + top_logprobs、完了logprobs + echo、ツール呼び出し (deepseekv41パーサー)、画像入力、推論努力レベル (low/high/xhigh/max + float [0, 0.99])、サンプリングパラメータ (temperature, top_p, stop, seed, frequency_penalty, presence_penalty, json_object)、8方向同時実行、35,572トークンでの40k単語プロンプト。
実行方法:
DeepseekV41ForCausalLMのサポートは、サービングスタックに展開中です (2026年9月現在)。以下に2つの検証済みレシピを示します (いずれも4×H200 NVLinkで検証済み)。
レシピA — 完全な1Mコンテキスト、DSpark投機的デコーディング有効 (インタラクティブ / 長コンテキスト)
export SGLANG_ENABLE_DSV41_ENGRAM_HOST_TABLE=1
export SGLANG_RAGGED_VERIFY_MODE=cap-accept
export PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True
sglang serve \
--model-path dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8 \
--tp-size 4 --ep-size 4 \
--host 0.0.0.0 --port 8000 \
--context-length 1048576 \
--mem-fraction-static 0.80 \
--max-running-requests 20 \
--cuda-graph-max-bs-decode 20 \
--reasoning-parser deepseek-v41 --tool-call-parser deepseekv41 \
--speculative-algorithm DSPARK \
--speculative-dspark-sps-table-path /path/to/dspark_sps.json \
--trust-remote-code
1Mコンテキストでの同時実行性は、KVバジェットにより4×H200で約20に制限されます。DSpark SPSコストテーブルは一度オフラインでプロファイルされます (下記参照)。cap-acceptモードと実際のSPSテーブルがない場合、投機的バジェットはverify-allに低下し、利点は失われます。
レシピB — 256kコンテキスト、高同時実行性、投機なし (バッチ / スループット)
export SGLANG_ENABLE_DSV41_ENGRAM_HOST_TABLE=1
export PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True
sglang serve \
--model-path dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8 \
--tp-size 4 --ep-size 4 \
--host 0.0.0.0 --port 8000 \
--context-length 262144 \
--mem-fraction-static 0.85 \
--reasoning-parser deepseek-v41 --tool-call-parser deepseekv41 \
--trust-remote-code
最大256の同時実行リクエストを処理します。Engramを使用した場合のmax_total_num_tokensは約20.6Mと報告されています。