Tillbaka till Nyheter
ProduktAI Understanding genomgång

Qwen presenterar Qwen3.8-Flash-Next som en öppen förhandsvisning av sin nästa arkitektur

Qwen beskriver Qwen3.8-Flash-Next som en multimodal blandning-av-expert-modell med totalt 125 miljarder tokens och 6 miljarder aktiva parametrar, och säger att den förhandsgranskar arkitekturen planerad för Qwen4.

5 min readRead the linked source
Source-page capture accompanying Qwen presents Qwen3.8-Flash-Next as an open-weight preview of its next architecture
KällhänvisningKälla inspelad
Förläggare
qwen.ai
Källlänk
qwen.aihttps://qwen.ai/blog?id=qwen3.8-flash-next
Källtyp
Länkad källa – status för primär källa har inte fastställts.
Också citerad

Berättelsen senast reviderad

SammanhangFörstå detta på 60 sekunder

Börja här

Nyckeltermer

Vikt
Ett inlärt numeriskt värde som skalar signaler som passerar genom ett neuralt nätverk.
Blandning av experter (MoE)
En arkitektur med specialiserade subnätverk där endast utvalda experter kör per ingång.
Minne (agentminne)
Lagrat sammanhang som en AI-agent använder över steg eller sessioner för att förbättra kontinuiteten.
Testa dig självAI Models Explained Quiz

Vad har förändrats sedan publiceringen

  1. Först publicerad
  2. Decrypt lägger till rapportering om samma planerade Qwen 3.8-Flash-Next förhandsvisning som täcks av den kanoniska uppdateringen. Det säger att Alibabas Qwen-team planerade en onsdagssläpp, beskriver modellen som en multimodal förhandsvisning av Qwen 4 och rapporterar att benchmarkpoäng och levande vikter ännu inte var tillgängliga. De rapporterade siffrorna på totalt 125 miljarder och 6 miljarder aktiva parametrar förblir obekräftade i det levererade materialet.
  3. Detta främjar väsentligt den kvalificerade Qwen3.8-Flash fortlöpande händelsen: Investing.com rapporterar att Alibaba har släppt produktionsmodellen Qwen3.8-Flash med nedladdningsbara vikter, QwenCloud-prissättning, rapporterade benchmark-poäng och kostnadsanspråk, samtidigt som Qwen3.8-Flash-Next släpper Qwen3.8-Flash-Next till sin planerade förhandsvisning av Q4.
  4. Blockchain.News utvecklar väsentligt samma Qwen3.8-Flash-Next release-händelse som representeras av den kanoniska uppdateringen. Den rapporterar frisläppandet av öppna vikter med 176 miljarder parametrar, beskriver Gated DeltaNet och Qwen Sparse Attention för sammanhang upp till 1 miljon tokens, citerar Alibabas genomströmningssiffror och rapporterar NVIDIA-validering på GB300 NVL72. Dessa uppgifter bekräftas inte oberoende av den angivna källan.
  5. Den primära källan Qwen lägger väsentligt till arkitektur- och testdetaljer till den befintliga Qwen3.8-Flash-Next-utgåvan: den beskriver modellen som en multimodal MoE-förhandsvisning för Qwen4, ger totalt 125 miljarder och 6 miljarder aktiva parametrar, och identifierar 72,5-gigabyte och 78-gigabyte-versioner av testade 98-byte GX. Gnista.
Source video from qwen.ai · shown with attribution.

Vad hände

Qwen:s källa presenterar Qwen3.8-Flash-Next som en öppen vikt multimodal blandning-av-expert-modell och en tidig förhandsvisning av arkitekturen som används i Qwen4. Källan säger att modellen innehåller 125 miljarder tokens totalt men aktiverar 6 miljarder, en design som den förknippar med en betydande prestandaökning. Den refererar också till kvantiserade versioner som testats på NVIDIA:s DGX Spark-system.

Qwen-sidan introducerar Qwen3.8-Flash-Next som "en annan modell med öppen vikt från Qwen." Den beskriver systemet som en multimodal MoE-modell och säger att det fungerar som en tidig förhandsvisning av arkitekturen som används i Qwen4. Det gör själva modellen till den centrala utvecklingen, medan Qwen4-referensen ger ett framtidsinriktat sammanhang om företagets modellfamilj. Källan anger inget formellt lanseringsdatum eller ett detaljerat releasemeddelande utöver denna beskrivning.

Källan ger två skala: totalt 125 miljarder tokens och 6 miljarder aktiva parametrar. Det presenterar skillnaden mellan dessa siffror som anledningen till att modellen får en "ganska stor prestandaökning." Det är ett påstående som gjorts av källan, inte ett resultat som självständigt visas i det medföljande materialet. Ingen benchmarktabell, jämförelsemodell, testprotokoll, svarstidsmätning eller kvalitetspoäng ingår, så den praktiska innebörden av den påstådda ökningen förblir obekräftad här.

Källan säger också att modellen har prövats på en DGX Spark med Unsloth-kvantiserade versioner. Den nämner specifikt en 72,5-gigabyte UD-IQ1_S-modell och en 78,9-gigabyte UD-Q2_K_XL-modell. Dessa detaljer indikerar att åtminstone några komprimerade eller kvantiserade former undersöks på den datorplattformen. Källan anger inte om dessa filer är officiellt distribuerade av Qwen, vilka precisionsavvägningar de gör eller om de är lämpliga för annan hårdvara.

Författaren säger att utforskningen fortsätter och identifierar ett föredraget resultat från en konfiguration med hög resonemangsansträngning av versionen UD-Q2_K_XL. Källan hänvisar också till genererade pelikanbilder, inklusive ett pelikan-rider-en-cykel-exempel. Dessa är anekdotiska demonstrationer snarare än en kontrollerad utvärdering. Materialet som tillhandahålls fastställer inte modellens bildkvalitet, resonemangssäkerhet, multimodala täckning, reproducerbarhet eller allmänna tillgänglighet.

Källinformation: qwen.ai ↗

Varför det spelar roll

Tillkännagivandet ger en tidig indikation på Qwen:s nästa modellarkitektur samtidigt som det betonar ett stort gap mellan totala och aktiva parametrar. Om källans beskrivning är korrekt kan modellen vara relevant för utvecklare som utvärderar system med öppen vikt som försöker kombinera bred modellkapacitet med lägre aktiv beräkning. Källan tillhandahåller dock inga oberoende riktmärken eller distributionsdata.

Tillkännagivandet är viktigt eftersom det kopplar ihop en tillgänglig modell med öppen vikt med arkitekturen Qwen säger kommer att informera Qwen4. Öppna vikter kan ge utvecklare och forskare ett objekt som de kan inspektera, anpassa eller köra inom sina egna miljöer, men källan anger inte de juridiska termerna som styr dessa användningar. Den praktiska betydelsen beror därför på licensiering och dokumentation som inte ingår här.

Modellens angivna arkitektur belyser en återkommande teknisk kompromiss: ett system kan ha ett stort totalt parameterantal samtidigt som det aktiverar en mycket mindre delmängd för en viss begäran. I den här källan presenterar Qwen totalt 125 miljarder parametrar och 6 miljarder aktiva parametrar som ett sätt att söka kapacitet med en lägre aktiv arbetsbelastning. Huruvida det leder till lägre kostnad, snabbare svar eller bättre kvalitet kan inte enbart avgöras från källan.

Den multimodala beskrivningen skulle kunna göra modellen relevant utöver endast texttillämpningar. Ändå är "multimodal" inte närmare definierad i det medföljande materialet. Det finns ingen inventering av in- eller utdatatyper, ingen beskrivning av språk eller media som stöds, och inga bevis om hur modellen hanterar verkliga bilder, komplexa instruktioner eller säkerhetskänsligt innehåll. De genererade pelikanexemplen visar endast att visuella utdata försöktes i den rapporterade utforskningen.

De kvantiserade versionerna är också praktiskt viktiga eftersom de gör modellens storlek och hårdvarukrav till en del av historien. Källan identifierar filer uppmätta till 72,5 och 78,9 gigabyte och säger att de testades på en DGX Spark. Det står inte om vanliga utvecklare kan köra dem, hur mycket minne de kräver i drift eller hur kvaliteten förändras under kvantisering. Dessa utelämnanden begränsar vad man ansvarsfullt kan sluta sig till om tillgänglighet.

Interactive Mechanism

Interaktiv mekanism: hur det faktiskt fungerar

Utforska den underliggande tekniken bakom denna utveckling interaktivt.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktiv konceptkontroll+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Vad du ska titta på härnäst

Viktiga okända uppgifter inkluderar modellens releasedatum, licens, modaliteter som stöds, benchmarkresultat, hårdvarukrav, säkerhetsutvärderingar och åtkomstvillkor. Ytterligare testning kommer att behövas för att avgöra om den rapporterade aktiva parameterdesignen ger konsekventa fördelar över praktiska arbetsbelastningar, och om de kvantiserade versionerna bevarar modellens kapacitet.

Första prioritet är bekräftelse av de formella releasevillkoren. Läsare och utvecklare behöver veta om Qwen3.8-Flash-Next är officiellt nedladdningsbart, vilka vikter och format som tillhandahålls, vilken licens som gäller och om användning är tillåten kommersiellt eller endast för forskning. Inget av dessa villkor anges i den medföljande källan.

Oberoende utvärderingar bör testa källans prestationspåstående. Användbar uppföljning skulle jämföra konfigurationen av 6 miljarder aktiva parametrar med andra öppna modeller för multimodal förståelse, generering, resonemang, kodning och uppgifter med långa sammanhang, samtidigt som hårdvara, kvantiseringsinställningar och latens rapporteras. Den aktuella källan erbjuder ingen sådan kontrollerad jämförelse.

Modellens säkerhets- och tillförlitlighetsprofil är också okänd. Inga röda team-fynd, vägranstest, hallucinationsmätningar, integritetsanalys eller missbruksskydd förekommer i materialet. Innan systemet används i följdinställningar, skulle utvecklare behöva bevis om fellägen för både text och visuell inmatning, tillsammans med tydlig vägledning om mänsklig granskning.

Slutligen bör Qwen4-anslutningen behandlas som en arkitektonisk förhandsvisning snarare än ett löfte om en framtida release. Källan säger att modellen förhandsgranskar arkitekturen som används i Qwen4, men den ger inget schema, specifikationer eller garanti för att den slutliga familjen kommer att matcha denna modell. Fortsatt testning kan klargöra om de rapporterade kvantiserade konfigurationerna och aktiva parameterdesignen är hållbara funktioner eller utforskande val.

Relaterade guider och frågesporter

AI-modeller förklarasTransformatorerAI utbildningChatGPT och LLM:erTesta vad du vet – prova ett gratis AI-quizSlå upp en AI-term i vår ordlistaFölj AI-modellens release tracker

Uppdateringar och korrigeringar

Denna kanoniska berättelse uppdateras på plats när händelsen som utvecklas väsentligt förändras. Dess URL och ursprungliga publiceringsdatum ändras aldrig.

  • Den primära källan Qwen lägger väsentligt till arkitektur- och testdetaljer till den befintliga Qwen3.8-Flash-Next-utgåvan: den beskriver modellen som en multimodal MoE-förhandsvisning för Qwen4, ger totalt 125 miljarder och 6 miljarder aktiva parametrar, och identifierar 72,5-gigabyte och 78-gigabyte-versioner av testade 98-byte GX. Gnista.
  • Blockchain.News utvecklar väsentligt samma Qwen3.8-Flash-Next release-händelse som representeras av den kanoniska uppdateringen. Den rapporterar frisläppandet av öppna vikter med 176 miljarder parametrar, beskriver Gated DeltaNet och Qwen Sparse Attention för sammanhang upp till 1 miljon tokens, citerar Alibabas genomströmningssiffror och rapporterar NVIDIA-validering på GB300 NVL72. Dessa uppgifter bekräftas inte oberoende av den angivna källan.
  • Detta främjar väsentligt den kvalificerade Qwen3.8-Flash fortlöpande händelsen: Investing.com rapporterar att Alibaba har släppt produktionsmodellen Qwen3.8-Flash med nedladdningsbara vikter, QwenCloud-prissättning, rapporterade benchmark-poäng och kostnadsanspråk, samtidigt som Qwen3.8-Flash-Next släpper Qwen3.8-Flash-Next till sin planerade förhandsvisning av Q4.
  • Decrypt lägger till rapportering om samma planerade Qwen 3.8-Flash-Next förhandsvisning som täcks av den kanoniska uppdateringen. Det säger att Alibabas Qwen-team planerade en onsdagssläpp, beskriver modellen som en multimodal förhandsvisning av Qwen 4 och rapporterar att benchmarkpoäng och levande vikter ännu inte var tillgängliga. De rapporterade siffrorna på totalt 125 miljarder och 6 miljarder aktiva parametrar förblir obekräftade i det levererade materialet.
Se den offentliga korrigeringsloggen
Hittade du detta användbart?