Haberlere Geri Dön
YenilikAI Understanding brifing

Preprint, LLM nicelemesinin sayı formatı için tasarlanmış dönüşümlere ihtiyacı olduğunu savunuyor

Bir arXiv ön baskı anketi, büyük dil modellerini nicelemeden önce kullanılan dönüşüm yöntemlerini dönüştürür ve klasik dönüşüm kodlaması ile gruplandırılmış, paylaşılan ölçekli niceleme arasındaki çelişkiyi tanımlar. En iyi dönüşümün ortaklaşa dağıtım formatına ve ölçek bilgisinin nasıl tahsis edildiğine bağlı olduğunu savunuyor.

5 min readRead the primary source
Primary-source image accompanying Preprint argues LLM quantization needs transforms designed for the number format
Birincil kaynak belgeKaynak kaydedildi
Yayıncı
arxiv.org
Kaynak bağlantısı
arxiv.orghttps://arxiv.org/abs/2608.25188
Kaynak türü
Birincil belge – doğrudan okuduğumuz resmi bir duyuru, belge, dosyalama veya birinci taraf sayfası.
Bağlam60 saniyede bunu anlayın

Buradan başlayın

Anahtar terimler

Büyük Dil Modeli (LLM)
Metin oluşturmak ve analiz etmek için çok büyük metin toplulukları üzerinde eğitilmiş bir dil modeli.
Niceleme
Model ağırlıklarını 8 bit veya 4 bit gibi daha düşük hassasiyetli formatlara dönüştürme.
Bellek (Ajan Belleği)
Bir AI aracısının sürekliliği artırmak için adımlar veya oturumlar boyunca kullandığı kayıtlı bağlam.
Kendinizi test edinYapay Zeka Modelleri Açıklaması Testi

Ne oldu?

25 Ağustos 2026'da arXiv'ye gönderilen Ehsan Jokar'ın ön baskısı, rekabetçi 4 bitlik geniş dil modelli nicemleme ardışık düzenlerindeki dönüşüm aşamasını inceliyor. "Büyük Ters Çevirme" olarak adlandırdığı şeyi resmileştirir: klasik dönüşüm kodlaması sinyal enerjisinin yoğunlaştırılmasını desteklerken, dağıtılmış gruplandırılmış nicemleme genellikle yuvarlamadan önce her grup içindeki değerlerin düzleştirilmesinden yararlanır.

Kaynak, Ehsan Jokar tarafından 25 Ağustos 2026'da sunulan bir arXiv ön baskısıdır. Özellikle büyük dil modellerine, ağırlıkları veya aktivasyonları düşük bitli temsillere yuvarlanmadan önce uygulanan dönüşümlere odaklanır. Makale, birçok rekabetçi 4 bitlik araştırma hattının, değerlerin nicelleştirilmesini kolaylaştırmak için ilk olarak döndürme, ölçeklendirme, permütasyon veya ortogonal olmayan afin dönüşüm gibi doğrusal, işlevi koruyan bir işlem uyguladığını söylüyor. Belirtilen katkısı, yazarın daha önce özel bir anket almadığını belirttiği dönüşüm aşamasını organize etmektir.

Makalenin düzenleme fikri "Büyük Ters Çevirme"dir. Klasik dönüşüm kodlamasında sistem, bir kaynağın ilişkisini bozabilir, farklı sayıda bitleri farklı koordinatlara tahsis edebilir ve ardından bunları nicemleyebilir. Kaynak, bu esnek tahsis hedefi kapsamında, enerjinin yoğunlaştırılmasının bozulmayı azaltabileceğini söylüyor; Gauss kaynağı için yüksek oranlı sonuç olarak Karhunen-Loeve dönüşümünü verir. Makale bunu, her grup için bir mutlak maksimum ölçek ve grup genelinde eşit bit genişlikleri kullanan konuşlandırılmış bir matris talimatı işlenen döşemesi ile karşılaştırmaktadır. Bu kısıtlama altında, belirtilen amaç bunun yerine bir grup içindeki değerlerin daha tekdüze hale getirilmesinden yanadır; bu sonuç, makalenin Hadamard tarzı tutarsızlıkla ilişkilendirdiği bir sonuçtur.

Jokar, karşıtlığın grup içi çoğunluklaştırma yoluyla resmileştirilebileceğini söylüyor ve her reçetenin kendi hedefine göre desteklendiğini, ancak genel bir spektrum için aralarında transferlerin genel bir optimallik garantisi olmadığını kanıtlıyor. Makale daha sonra ikinci tasarım ekseni olarak sayı formatını ekliyor. Düzgün olmayan bir FP4 ızgarasının düzleştirmenin faydasını azalttığını, MXFP4'ün iki bloğun gücü ölçeğinin hâlâ ilgili blokla sınırlı rotasyonları desteklediğini ve NVFP4'ün mantis taşıyan ölçeğinin bu baskıyı büyük ölçüde ortadan kaldırdığını söylüyor. Haziran 2026'ya kadar 200 çalışmayı inceleyen ön baskı raporları, 43 dönüşüm yöntemini yapıya, veri farkındalığına, aranmış veya oluşturulmuş olup olmadıklarına, çalışma zamanı maliyetine ve bildirildiği yerlerde GPTQ yuvarlamayla kombinasyonlarına göre sınıflandırıyor.

Kaynak ayrıntıları: arxiv.org ↗

Neden önemli?

Makalenin temel iddiası, nicelemenin evrensel olarak en iyi tek bir dönüşüm tarafından yönetilmediğidir. Döndürmeler, ölçeklendirmeler, permütasyonlar ve diğer işlevi koruyan dönüşümler arasında seçim yapmak, çıkarım sırasında kullanılan belirli sayı formatını ve donanım odaklı gruplandırma kurallarını hesaba katmayı gerektirebilir.

Pratik sorun, büyük dil modellerini düşük bit aritmetiğiyle çalıştırmanın maliyeti ve güvenilirliğidir. Sayısal kesinliğin azaltılması, model çıkarımını daha kompakt veya verimli hale getirebilir ancak kaynak, dönüştürme sürecinin, değerlerin nasıl gruplandırıldığına ve ölçeklendirildiğine bağlı olduğunu açıkça ortaya koyuyor. Bir niceleme kuralına göre yardımcı olan bir dönüşüm, başka bir nicelik kuralı altında aynı faydayı sağlamayabilir. Bu, araştırmacılar ve mühendisler için yararlı bir kılavuzdur çünkü nicelemeyi, birbiriyle değiştirilebilir hileler dizisi yerine ortak bir algoritma ve format problemi olarak çerçeveler.

Makalenin format karşılaştırması argümana somut bir yayılma boyutu kazandırıyor. FP4, MXFP4 ve NVFP4, dört bitlik sayılar için değiştirilebilir etiketler olarak değerlendirilmiyor: kaynak, ölçek yapılarının, değerlerin yuvarlamadan önce nasıl düzenlenmesi gerektiği konusunda farklı teşvikler yarattığını söylüyor. Bu iddia testlerden sağ çıkarsa, model geliştiricilerin önce bir dönüşümü seçip aktaracağını varsaymak yerine, hedef donanım formatının yanında dönüşümleri seçmesi veya tasarlaması gerekebilir. Aynı mantık, farklı grup büyüklükleri, ölçek kuralları veya sayısal ızgaralar kullandıklarında kuantizasyon kağıtları arasında karşılaştırma yapmayı da zorlaştırabilir.

Katkı esas olarak mevcut çalışmaların yorumlanması ve karşılaştırılması için bir çerçeve olarak önemlidir. Sağlanan kaynakta yeni bir model sürümü, üretim dağıtımı, evrensel doğruluk iyileştirmesi veya tek bir kazanma yöntemi rapor edilmiyor. Aynı zamanda araştırılan yöntemlerin model aileleri, görevler veya donanımlar arasında eşit derecede iyi çalıştığını da ortaya koymaz. Makalenin, genel bir spektrum için transferlerin optimallik garantisinin olmamasının önemli bir sınırlama olduğuna dair kendi beyanı önemli bir sınırlamadır: teori, birbiriyle yarışan hedefleri tanımlar, ancak bir modelin çalışacağı spesifik ortamda ölçüm ihtiyacını ortadan kaldırmaz.

Interactive Mechanism

İnteraktif Mekanizma: Aslında Nasıl Çalışıyor?

Bu gelişmenin arkasında yatan teknolojiyi etkileşimli olarak keşfedin.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
İnteraktif Konsept Kontrolü+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Bundan sonra ne izlenecek?

Ön baskı bir anket ve teorik analizdir; üretim modellerinde veya donanımlarda tek bir dönüşümün kazandığının kanıtı değildir. Sonraki önemli kontroller, uçtan uca çıkarım testlerinde farklılıkların geçerli olup olmadığı, yöntemlerin doğruluğu ve çalışma süresini nasıl etkilediği ve gelecekteki uygulamaların dağıtım kılavuzunu pratik hale getirip getirmediğidir.

İlk soru ampirik doğrulamadır. Gelecekteki çalışmalar, makalenin birden fazla dil modeli mimarisi, grup konfigürasyonu ve çıkarım iş yükü boyunca enerji konsantrasyonu ile grup içi düzleşme arasındaki ayrımını test etmelidir. Sağlanan özet doğruluk, gecikme, bellek veya enerji sonuçları sağlamadığından, önerilen perspektifin pratik model seçimi kararlarını ne kadar değiştirdiğini belirlemek henüz mümkün değildir.

İkinci bir konu ise formata özgü iddiaların tam uygulamalarda sabit kalıp kalmayacağıdır. Makale, önceki çalışmaların bu bilgiyi bildirdiği GPTQ yuvarlamasıyla yöntemlerin nasıl oluşturulduğunu kaydettiğini ancak kaynağın evrensel bir tarif tanımlamadığını veya karşılaştırmalı sonuçlar vermediğini söylüyor. Okuyucular, yalnızca dönüşümü, ölçek kuralını ve düşük bit formatını değiştirirken modeli ve iş yükünü sabit tutan kontrollü değerlendirmeler aramalıdır.

Son olarak, makale birkaç operasyonel soruyu açık bırakıyor: her dönüşümün ne kadar çalışma süresi veya kalibrasyon maliyeti eklediği, veriye duyarlı yöntemlerin temsili kullanıcı verileri gerektirip gerektirmediği, sonuçların grup sınırlarına ne kadar duyarlı olduğu ve önerilen seçeneklerin ana akım çıkarım yazılımında mevcut olup olmadığı. Çoğaltma ve uygulama ayrıntıları, anketin pratik bir dağıtım rehberi mi olacağını yoksa öncelikle kuantizasyon literatürünün teorik bir haritası olarak mı kalacağını belirleyecektir.

İlgili kılavuzlar ve testler

Yapay Zeka Modellerinin AçıklamasıTransformatörlerYapay Zeka EğitimiYapay Zekanın GeleceğiBildiklerinizi test edin; ücretsiz bir yapay zeka testini deneyinSözlüğümüzde bir yapay zeka terimine bakınAI modeli sürüm izleyicisini takip edin
Bunu yararlı buldunuz mu?