テクニカルガイド

モデルの量子化

モデルの量子化では、数値をより少ないビットで保存することでニューラル ネットワークが縮小されるため、同じモデルがより高速に、より小型のハードウェアで実行されます。

2分の読書最終更新日

概要

It is the main reason large models can fit on a single GPU, a laptop, or even a phone.

ディープダイブ

トレーニングされたモデルは通常、各重みを 32 ビットまたは 16 ビットの浮動小数点数として保存します。量子化により、8 ビット整数 (INT8) や 4 ビット値 (INT4) などの低精度フォーマットに置き換えられ、メモリがおよそ 4 倍から 8 倍に削減されます。 16 ビットで約 140 GB を必要とする 700 億パラメータのモデルは、4 ビットでは 35 GB 近くまで削減でき、1 つのコンシューマ GPU に収まります。問題は精度です。広範囲の値を 256 または 16 個のバケットに詰め込むと詳細が失われます。 GPTQ、AWQ、QLoRA で使用される NF4 形式などの最新の手法では、スマートなスケーリング係数が選択され、最も機密性の高い重みが保護されるため、多くの場合、品質の低下は小さくなります。 llama.cpp や Ollama などのツールがデータ センターを使用せずにローカルで有能なモデルを実行できるのは、量子化のおかげです。

技術的な洞察

量子化では、スケールとゼロ点を使用して実数値を小さな整数グリッドにマップします:stored_int =round(value /scale) + zero_point。スケールを適切に選択することがゲームのすべてです。チャネルごとまたはグループごとのスケーリングは、重み行列のスライスに対して個別のスケールを保持し、重要な部分の精度を維持します。トレーニング後の量子化は完成したモデルを変換するだけですが、量子化を意識したトレーニングはトレーニング中に丸めをシミュレートするため、ネットワークは許容できるようになり、通常は低ビット精度が向上します。

戦略的影響

費用と予算

アーキテクチャの決定により、パフォーマンスと運用コストが何年にもわたって推進されます。

より明確な判決

技術教育は、チームが最新のスタックだけでなく、適切なスタックを選択するのに役立ちます。

品質管理

より良いエンジニアリングの選択により、本番環境での信頼性に関するインシデントが減少します。

モデル量子化の将来

精度の低下が常態化することが予想されます。研究では、信頼性の高い 4 ビット、2 ビット、さらにはバイナリの重み付けに加え、機密層をより高いレベルに保つ混合精度スキームを推進しています。ハードウェアは次のとおりです。GPU と電話チップには、ネイティブ INT8、INT4、および FP8 演算ユニットが含まれるようになりました。 FP8 や MXFP4 などの形式は、浮動小数点数の範囲と整数のサイズを組み合わせることが目的です。 QLoRA などの技術と組み合わせることで、量子化によりフロンティアスケールのモデルを日常のデバイスでより安価に実行し、微調整できるようになります。

現実世界の実装

4 ビット GGUF ファイルを使用して、llama.cpp または Ollama を使用してラップトップ上で 7B または 13B Llama モデルを実行します。

QLoRA は、基本重みを 4 ビット NF4 で固定したままにすることで、単一 GPU 上で大規模なモデルを微調整します。

オンデバイス ランタイムを備えた電話機に INT8 モデルを展開することで、アシスタントがオフラインでプライベートに作業できるようになります。

INT8/FP8 量子化によりスループットが約 2 倍になり、メモリ コストが削減される、より安価な API エンドポイントを提供します。

リスクとガードレール

1 つのベンチマークを最適化すると、より広範なシステムの弱点が隠れる可能性があります。

インフラストラクチャとメンテナンスのコストは過小評価されがちです。

システムが複雑になるにつれて、セキュリティと可観測性のギャップが拡大する可能性があります。

実装ロードマップ

1

実装前にレイテンシ、品質、コストの目標を定義します。

2

現実的な負荷とデータ条件でのベンチマーク。

3

エラー、ドリフト、ユーザーへの影響を計測器で監視します。

4

スケーリングの前に、ロールバックとインシデント対応のパスを準備します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Model Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

モデルレジストリ

よくある質問

What is Model Quantization?

モデルの量子化では、数値をより少ないビットで保存することでニューラル ネットワークが縮小されるため、同じモデルがより高速に、より小型のハードウェアで実行されます。これが、大規模なモデルが 1 つの GPU、ラップトップ、さらには携帯電話に収まる主な理由です。

モデルの量子化によってニューラル ネットワークに関して主に何が変わるのでしょうか?

量子化により、同じパラメータがより少ないビットで保存され (たとえば、16 ビットまたは 32 ビット浮動小数点の代わりに INT8 または INT4)、メモリが削減され、計算が高速化されます。

モデルを 16 ビットから 4 ビットに変換すると、おおよそどれくらいのメモリを節約できますか?

重みあたり 16 ビットから 4 ビットにすると、ストレージが約 4 分の 1 に削減されます。そのため、巨大なモデルを 1 つの GPU に収めることができます。

積極的な低ビット量子化の主な欠点は何ですか?

広範囲の値を少数の離散レベルにマッピングすると詳細が失われるため、スマート スケーリングで機密の重みが保護されない限り、品質が低下する可能性があります。

量子化を意識したトレーニングはトレーニング後の量子化とどう違うのでしょうか?

量子化対応トレーニングではトレーニング ループに丸め誤差が組み込まれるため、ネットワークが適応し、通常は低いビット幅でもより高い精度を維持します。

1 つの GPU で大規模なモデルの微調整を手頃な価格で行うために、4 ビット量子化を使用する手法はどれですか?

QLoRA は、ベース モデルを 4 ビット NF4 形式で固定し、小さなアダプターの重みをトレーニングして、大きなモデルを控えめなハードウェアで微調整できるようにします。