モデルの結合
モデルの結合では、再トレーニングや元のトレーニング データへのアクセスを行わずに、2 つ以上のトレーニング済みニューラル ネットワークの重みを 1 つのモデルに結合します。
概要
It matters because it lets teams blend specialized skills cheaply, turning expensive fine-tuned models into reusable building blocks.
ディープダイブ
モデルの結合では、同じアーキテクチャを共有する複数のモデルの実際のパラメータ (重み) が融合されます。最も単純な方法である重み平均は、対応する重みの平均を取るだけです。より賢い方法は、「タスク ベクトル」、つまり微調整されたモデルとそのベースの違いを使用して機能します。タスクベクトルを追加するとスキルが注入されます。それを差し引くと、望ましくない動作を取り除くことができます。 TIES-Merging や DARE などの技術は、これらのベクトルをトリムおよび再スケールして、多くのモデルが結合される場合の干渉を軽減します。勾配降下法やデータは必要ないため、マージはラップトップ上で数秒で実行されます。問題点は、モデルが共通のベースから派生し、ウェイト空間の互換性のある領域に存在する場合にのみ機能することです。
技術的な洞察
重要なアイデアは、微調整により、基本モデルに近い比較的平坦な「損失盆地」に沿って重みを移動させるということです。タスク ベクトルは単純に (微調整された重みから基本重みを引いたもの) です。これらのベクトルはほぼ線形であり、さまざまなタスクにわたってほぼ直交していることが多いため、いくつかを加算すると、結合されたモデルで各スキルが保持されます。 TIES と DARE は、まず小さな重みデルタまたは矛盾する重みデルタを取り除いて符号の不一致をカットし、次にマージして、あるタスクが別のタスクを上書きするのを防ぎます。
戦略的影響
費用と予算
アーキテクチャの決定により、パフォーマンスと運用コストが何年にもわたって推進されます。
より明確な判決
技術教育は、チームが最新のスタックだけでなく、適切なスタックを選択するのに役立ちます。
品質管理
より良いエンジニアリングの選択により、本番環境での信頼性に関するインシデントが減少します。
モデル結合の未来
合併がモデル「サプライチェーン」の標準的な部分になることが期待されます。ハブはすでに何千ものマージ可能なチェックポイントをホストしており、マージキットのようなツールによりレシピを共有できるようになります。研究は、自動マージ検索 (階層ごとのブレンド比率を選択する進化的アルゴリズム)、わずかに異なるアーキテクチャ間でのマージ、および専門家の混合コンポーネントのオンザフライのマージに向けて進んでいます。オープンな微調整が急増するにつれて、マージにより機能を構成するためのほぼ無料の方法が提供されますが、マージされたモデルのライセンスと来歴にはより明確な基準が必要になります。
現実世界の実装
コーディング調整されたモデルとチャット調整されたモデルをブレンドすることで、1 つの LLM がコードの作成と会話の両方を再トレーニングすることなく自然に行うことができます。
日本語モデルと英語数学モデルを組み合わせて、強力な日本語数学ソルバーを生成する進化的なマージ実験。
新しい安全性データを収集せずに、モデルの重みから「毒性」タスク ベクトルを減算して、有害な出力を削減します。
異なる筆記スタイルでトレーニングされた複数の LoRA アダプターを、トーンを柔軟に切り替えることができる 1 つのモデルに統合します。
リスクとガードレール
1 つのベンチマークを最適化すると、より広範なシステムの弱点が隠れる可能性があります。
インフラストラクチャとメンテナンスのコストは過小評価されがちです。
システムが複雑になるにつれて、セキュリティと可観測性のギャップが拡大する可能性があります。
実装ロードマップ
実装前にレイテンシ、品質、コストの目標を定義します。
現実的な負荷とデータ条件でのベンチマーク。
エラー、ドリフト、ユーザーへの影響を計測器で監視します。
スケーリングの前に、ロールバックとインシデント対応のパスを準備します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Model Merging quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
さかなAI進化モデル融合
よくある質問
What is Model Merging?
モデルの結合では、再トレーニングや元のトレーニング データへのアクセスを行わずに、2 つ以上のトレーニング済みニューラル ネットワークの重みを 1 つのモデルに結合します。これが重要なのは、チームが専門的なスキルを安価に融合させ、高価な微調整されたモデルを再利用可能な構成要素に変えることができるためです。
モデルのマージでは主に何を組み合わせますか?
モデルのマージは、データやランタイム出力を結合するのではなく、学習したモデルの重み/パラメーターに直接作用し、それらを 1 つのセットに融合します。
モデルのマージは、なぜ小規模なハードウェアで数秒で実行できるのでしょうか?
マージは基本的に既存の重みに対する重み付けされた算術演算であるため、コストのかかる逆伝播やデータパスは必要ありません。
TIES-Merging や DARE などの手法は具体的にどのような問題に対処しますか?
TIES と DARE は、競合する (反対符号の) 更新を減らすためにタスク ベクトルをプルーニングおよび再スケーリングするため、あるタスクが別のタスクを上書きすることはありません。
マージを使用して望ましくない動作を *削除*するにはどうすればよいでしょうか?
毒性などの望ましくない特性に関連付けられたタスク ベクトルを否定 (減算) すると、モデルをその動作から遠ざけることができます。