HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

中国のAI競争にダークホース登場:StartLux

A dark horse enters China's AI race: StartLux (chinaonchina.com)

37 pointsby try-working17 コメント

要約

インターネット界の「プログラマーのゴッドファーザー」として知られる陳丹陽(チェン・ダニアン)氏が、引退から10年を経てAI分野に復帰し、大規模モデルレースに参入しました。同氏が設立したStartLuxは、パラメータ数27Bのローカルモデル「StartLux-V1.0-27B-Preview」で、CAICTのベンチマークテストにおいて1.6兆パラメータのDeepSeek-V4-Proに僅差で迫る2位を獲得しました。このモデルは、PC上で動作し、クラウドベースの大規模モデルに匹敵するエージェント能力を持つとされています。

全文翻訳

FEATURE9分読み陳丹陽(チェン・ダニアン)が復帰、大規模モデル分野に参入大きな出来事が起こりました。中国の国内大手大規模モデル開発者の間で、ダークホースが登場したのです。パラメータ数がわずか27Bの最初のモデルを持つ新会社が、CAICT MCP専門テストで総合2位を獲得しました。その上位にいるのは、梁文峰(リャン・ウェンフェン)が約1年間秘密裏に温存してきた切り札、1.6兆パラメータを誇るDeepSeek-V4-Proです。両者の差はわずか1.3パーセントポイントです。このダークホースこそ、StartLux(旧名:元点星輝)のStartLux-V1.0-27B-Previewです。あまり馴染みのない名前かもしれませんね。心配はいりません。その創業者兼CEOは旧知の人物、陳丹陽(チェン・ダニアン)です。インターネット時代の「プログラマーのゴッドファーザー」として知られる彼の功績は公然の事実です。盛大網絡(シャンダーネットワーク)の共同創業者であり、連尚網絡(リエンシャンネットワーク)の責任者であり、中国で最も早く「シェアウェア」の概念を導入したプログラマーの一人です。10年間の引退後、彼は復帰し、今回はローカルモデルに賭けています。これは、陳丹陽(チェン・ダニアン)氏の最近の珍しい公の場での発言とも関連があります。盛大創新研究院の18周年記念同窓会で、彼は「AI時代の8つの非コンセンサスな見解」を公に発表し、そのうち4つはローカルモデルに焦点を当てています。ローカルモデルはクラウド市場を完全に破壊し、3年でClaudeに追いつき、市場の80%を占めるでしょう。パラメータに基づくモデル競争は時代遅れになるでしょう…StartLuxは彼の考えを最もよく表しています。同社のビジネスは業界のトレンドに従わず、むしろ「小さくて美しい」ローカルモデルの商業化に焦点を当てており、真の意味で世界初の真のローカルモデル企業となっています。最初の市場志向のスコアカードとして、StartLux-V1.0-27B-Previewはクラウドに依存せず、コンシューマーグレードのPCで直接実行できます。つまり、この約60倍小さいローカルモデルは、1兆パラメータ規模のクラウドベースのフラッグシップモデルに匹敵するエージェント能力を持っているのです。これにはどのような根拠があるのでしょうか?小規模モデルが大きな成果を上げる、27Bが1.6Tを上回る回答が明らかになる前に、比較対象を見てみましょう。しばしば、2位は忘れられると言われますが、それは1位がDeepSeekでない限りです。さらに、その差はわずかであり、議論する価値は十分にあります。結果は、権威ある機関である中国情報通信研究院(CAICT)の信頼できるAI大規模モデルベンチマークテストMCP特別項目からのもので、実際のアプリケーションシナリオを中心に6種類のタスクを設定しています。位置ナビゲーション、ウェブ検索、ブラウザ自動化、金融分析、コードリポジトリ管理、3Dデザイン。さらに、エージェントのマルチツール連携、複雑なタスク実行、実環境での対話能力を評価する総合評価が追加されます。簡単に言えば、MCP-Universeはモデルの応答を評価するのではなく、実際に物事を成し遂げられるかどうかを評価します。これはエージェントの品質を判断する上で最も基本的な側面でもあります。結果は、StartLux-V1.0-27B-Previewが総合スコア39.25%で2位になったことを示しました。パラメータ数2840億以上のDeepSeek-V4-Flash-0731と、1980億のStep-3.7-Flashは、DeepSeek-V4-Proにわずか1.3パーセントポイント差で続いています。同じ27Bパラメータ規模で、StartLuxはQwen 3.6を5.34パーセントポイント上回りました。個別の科目でも優れており、位置ナビゲーション、金融分析、ブラウザ自動化で1位を獲得し、その他のサブ項目も高順位でした。データはさておき、2つのケーススタディを見てみましょう。最初の質問は、2年間のマイクロソフト株への投資に関するもので、競合はClaude Sonnet 4.6です。Claudeの回答は次のとおりです:$47,254、89.02%。ビデオリンク:https://mp.weixin.qq.com/s/365CtdgGYFlEKNDICtoCfgStartLuxの回答:$47,499.09、90.00%。似ているように見えるかもしれませんが、金融業界では、わずかな違いが甚大な損失につながる可能性があります。両モデルの推論プロセスを注意深く調べると、Claude Sonnet 4.6は生データの欠落により、2025年1月8日を非取引日と誤認し、前日の終値を計算しました。同じ状況下で、StartLuxは元のデータを遡ってレビューし、ターゲット日付周辺の市場動向を確認して正確な終値を確認してから計算を完了し、視覚化を生成しました。最終的に、StartLuxが到達した結論は正しく、完全に検証可能で追跡可能でした。2番目のタスクはより単純でした。両モデルは同時にブラウザで航空券を検索するように求められました。私はブラウザを開いたり、Googleフライトのようなライブウェブサイトと対話したりすることはできません。テキストのみを処理でき、リアルタイムのブラウジング機能はありません。このフライトを自分で見つけるには、次の手順を実行します:1. google.com/flightsにアクセスします。2. シンガポール(SIN)→北京を入力します。3. 片道を選択し、出発日を今日から5日後に設定します。4. 「直行便」と「エコノミー」でフィルタリングします。5. 結果を確認します。北京へのフライトは、首都(PEK)または大興(PKX)に着陸する可能性があることに注意してください。大興着陸便は除外します。6. 価格を比較し、PEKに着陸する最も安い直行便を選択します。必要であれば、このルートでの典型的な価格帯、航空会社のオプション、または格安航空券を見つけるための一般的なヒントについて考えるお手伝いができます。その中で、StartLux-V1.0-27B-Previewは約95秒で検索を完了し、299ドルの中国国際航空のチケットを見つけました。対照的に、Claude Sonnet 4.6は、日付選択、ポップアップの dismissal、フィルターメニューの操作中に複数のスクリーンショット確認が必要で、一度は時間フィルターパネルを誤ってトリガーしました。200秒以上経過した後、最低価格556ドルを提示しました。価格は高く、検索時間もStartLuxの2倍でした。特に、操作パスの観点から、StartLuxははるかに簡潔で、わずか12ステップしか必要としませんが、Sonnetは完全な21ステップを必要とします。これは、エージェントタスクにおいて、パラメータの規模がもはや唯一の決定的な変数ではないことを示すのに十分です。ポストトレーニングを通じて新しい変数が導入されています。価格を下げる、能力を下げるのではないStartLux-V1.0-27B-Previewはゼロからトレーニングされたわけではありません。Qwen3.6-27Bに基づいてもいますが、最終テストスコアはQwenよりも大幅に高く、その理由はタスクデータと自動化されたポストトレーニング方法にあります。簡単に言えば、StartLuxはより有能なエージェントをトレーニングしており、トレーニングデータはタスク理解、ツール選択、パラメータ構築、複数ステップ実行、ステータスチェック、結果検証などの能力を強化することに焦点を当てています。モデルは最終テキストを出力するだけでなく、いつどのツールを呼び出すか、ツールが例外を返したときにどのように調整するか、どのような状況でタスク完了を宣言できるかを学ぶ必要があります。さらなるトレーニングは、このプロセスをさらに推進します。チームは、AIによってトレーニングされたAI(Auto Research)手法を使用して、モデルがツール環境で自律的にタスクを実行し、環境フィードバックに基づいて戦略を継続的に調整できる、全く新しい多次元的で検証可能かつスケーラブルなモデル反復最適化技術を独自に開発しました。例えば、前述の金融分析ケース(バックテストと改訂を含む)や、ブラウザタスクにおける制約特定とパス選択は、ポストトレーニングの最も直感的な現れです。公式情報によると、StartLux-V1.0-27B-Previewは、Auto Research手法を用いてポストトレーニングを完了した国内初のローカルエージェントモデルでもあります。これはスケーリング則が無効になったことを意味するものではありません。大規模パラメータのクラウドモデルは依然として現在の主流の選択肢ですが、StartLuxも明確なシグナルを送っています。これは唯一の解決策ではないということです。陳丹陽(チェン・ダニアン)の言葉を借りれば、スケーリング則は「通り過ぎる仙人」であり、それなしではAIは離陸できませんが、AIの開発経路を通り過ぎただけで、