Quay lại Tin tức
sản phẩmAI Understanding tóm tắt

Qwen giới thiệu Qwen3.8-Flash-Next dưới dạng bản xem trước mở của kiến trúc tiếp theo

Qwen mô tả Qwen3.8-Flash-Next là mô hình hỗn hợp các chuyên gia đa phương thức với tổng số 125 tỷ mã thông báo và 6 tỷ tham số hoạt động, đồng thời cho biết nó xem trước kiến trúc được lên kế hoạch cho Qwen4.

5 min readRead the linked source
Source-page capture accompanying Qwen presents Qwen3.8-Flash-Next as an open-weight preview of its next architecture
Nguồn tham khảoNguồn đã ghi
Nhà xuất bản
qwen.ai
Liên kết nguồn
qwen.aihttps://qwen.ai/blog?id=qwen3.8-flash-next
Loại nguồn
Nguồn được liên kết - trạng thái nguồn chính chưa được thiết lập.
Cũng được trích dẫn

Câu chuyện được sửa đổi lần cuối

Bối cảnhHiểu điều này trong 60 giây

Bắt đầu ở đây

Thuật ngữ chính

cân nặng
Một giá trị số đã học để chia tỷ lệ các tín hiệu truyền qua mạng nơ-ron.
Hỗn hợp các chuyên gia (MoE)
Một kiến trúc với các mạng con chuyên biệt, nơi chỉ các chuyên gia được chọn mới chạy trên mỗi đầu vào.
Bộ nhớ (Bộ nhớ tác nhân)
Bối cảnh được lưu trữ mà tác nhân AI sử dụng qua các bước hoặc phiên để cải thiện tính liên tục.
Tự kiểm traCâu đố giải thích về mô hình AI

Điều gì đã thay đổi kể từ khi xuất bản

  1. Xuất bản lần đầu
  2. Decrypt bổ sung thêm báo cáo về bản xem trước Qwen 3.8-Flash-Next theo kế hoạch tương tự được bao gồm trong bản cập nhật chuẩn. Nó cho biết nhóm Qwen của Alibaba đã lên kế hoạch phát hành vào thứ Tư, mô tả mô hình này như một bản xem trước đa phương thức của Qwen 4 và báo cáo rằng điểm chuẩn và trọng lượng trực tiếp vẫn chưa có. Con số tổng cộng 125 tỷ và 6 tỷ tham số hoạt động được báo cáo vẫn chưa được xác minh trong tài liệu được cung cấp.
  3. Điều này thúc đẩy đáng kể sự kiện tiếp tục Qwen3.8-Flash đủ điều kiện: Investing.com báo cáo rằng Alibaba đã phát hành mô hình Qwen3.8-Flash sản xuất với trọng lượng có thể tải xuống, giá QwenCloud, điểm chuẩn được báo cáo và yêu cầu chi phí, đồng thời phát hành bản xem trước Qwen3.8-Flash-Next được liên kết với kiến ​​trúc Qwen4 theo kế hoạch của nó.
  4. Blockchain.News cải thiện đáng kể sự kiện phát hành Qwen3.8-Flash-Next được thể hiện bằng bản cập nhật chuẩn. Nó báo cáo việc phát hành trọng lượng mở 176 tỷ tham số, mô tả Gated DeltaNet và Qwen Sparse Chú ý cho các bối cảnh lên tới 1 triệu mã thông báo, trích dẫn số liệu thông lượng của Alibaba và báo cáo xác thực NVIDIA trên GB300 NVL72. Những chi tiết này không được xác nhận độc lập trong nguồn được cung cấp.
  5. Nguồn chính Qwen bổ sung một cách quan trọng các chi tiết về kiến ​​trúc và thử nghiệm cho mục phát hành Qwen3.8-Flash-Next hiện có: nó mô tả mô hình này như một bản xem trước MoE đa phương thức cho Qwen4, cung cấp tổng cộng 125 tỷ và 6 tỷ tham số hoạt động, đồng thời xác định các phiên bản lượng tử hóa 72,5 gigabyte và 78,9 gigabyte được thử nghiệm trên DGX Spark.
Source video from qwen.ai · shown with attribution.

Chuyện gì đã xảy ra

Nguồn của Qwen trình bày Qwen3.8-Flash-Next dưới dạng mô hình hỗn hợp các chuyên gia đa phương thức có trọng lượng mở và bản xem trước sớm của kiến ​​trúc được sử dụng trong Qwen4. Nguồn tin cho biết mô hình này chứa tổng cộng 125 tỷ token nhưng kích hoạt 6 tỷ, một thiết kế mà nó liên kết với việc tăng hiệu suất đáng kể. Nó cũng tham khảo các phiên bản lượng tử hóa được thử nghiệm trên hệ thống DGX Spark của NVIDIA.

Trang Qwen giới thiệu Qwen3.8-Flash-Next là “một mẫu tạ mở khác từ Qwen”. Nó mô tả hệ thống này như một mô hình MoE đa phương thức và cho biết nó đóng vai trò là bản xem trước ban đầu của kiến ​​trúc được sử dụng trong Qwen4. Điều đó khiến bản thân mô hình trở thành trung tâm phát triển, trong khi tài liệu tham khảo Qwen4 cung cấp bối cảnh hướng tới tương lai về dòng mô hình của công ty. Nguồn không cung cấp ngày ra mắt chính thức hoặc thông báo phát hành chi tiết ngoài mô tả này.

Nguồn đưa ra hai con số tỷ lệ: tổng số 125 tỷ mã thông báo và 6 tỷ tham số hoạt động. Nó cho thấy sự khác biệt giữa những con số đó là lý do khiến mẫu xe này nhận được “mức tăng hiệu suất khá lớn”. Đó là tuyên bố của nguồn, không phải là kết quả được chứng minh độc lập trong tài liệu được cung cấp. Không có bảng điểm chuẩn, mô hình so sánh, giao thức kiểm tra, phép đo thời gian phản hồi hoặc điểm chất lượng nào được đưa vào, vì vậy ý ​​nghĩa thực tế của mức tăng được tuyên bố vẫn chưa được xác minh ở đây.

Nguồn tin cũng cho biết model này đã được thử nghiệm trên DGX Spark sử dụng phiên bản lượng tử hóa Unsloth. Nó đặc biệt đề cập đến mẫu UD-IQ1_S 72,5 gigabyte và mẫu UD-Q2_K_XL 78,9 gigabyte. Những chi tiết này chỉ ra rằng ít nhất một số dạng nén hoặc lượng tử hóa đang được kiểm tra trên nền tảng điện toán đó. Nguồn không cho biết liệu các tệp đó có được phân phối chính thức bởi Qwen hay không, chúng có những đánh đổi chính xác nào hoặc liệu chúng có phù hợp với phần cứng khác hay không.

Tác giả cho biết việc khám phá vẫn đang tiếp tục và xác định một kết quả ưu tiên từ cấu hình nỗ lực lý luận xhigh của phiên bản UD-Q2_K_XL. Nguồn này cũng đề cập đến các hình ảnh bồ nông được tạo ra, bao gồm cả ví dụ về bồ nông cưỡi xe đạp. Đây là những minh chứng mang tính giai thoại hơn là một đánh giá có kiểm soát. Tài liệu được cung cấp không xác định chất lượng hình ảnh, độ tin cậy lý luận, phạm vi bao phủ đa phương thức, khả năng tái tạo hoặc tính khả dụng chung của mô hình.

Chi tiết nguồn: qwen.ai ↗

Tại sao nó quan trọng

Thông báo này đưa ra dấu hiệu sớm về kiến ​​trúc mô hình tiếp theo của Qwen, đồng thời nhấn mạnh khoảng cách lớn giữa các tham số tổng và tham số hoạt động. Nếu mô tả của nguồn là chính xác thì mô hình có thể phù hợp với các nhà phát triển đang đánh giá các hệ thống trọng lượng mở đang tìm cách kết hợp công suất mô hình rộng với khả năng tính toán hoạt động thấp hơn. Tuy nhiên, nguồn không cung cấp điểm chuẩn hoặc dữ liệu triển khai độc lập.

Thông báo này quan trọng vì nó kết nối một mô hình trọng lượng mở có sẵn với kiến ​​trúc mà Qwen cho biết sẽ thông báo cho Qwen4. Trọng lượng mở có thể cung cấp cho các nhà phát triển và nhà nghiên cứu một đối tượng mà họ có thể kiểm tra, điều chỉnh hoặc chạy trong môi trường của riêng họ, nhưng nguồn không chỉ định các điều khoản pháp lý chi phối những mục đích sử dụng đó. Do đó, ý nghĩa thực tế phụ thuộc vào việc cấp phép và tài liệu không được đề cập ở đây.

Kiến trúc đã nêu của mô hình nêu bật sự cân bằng kỹ thuật định kỳ: một hệ thống có thể có tổng số tham số lớn trong khi kích hoạt một tập hợp con nhỏ hơn nhiều cho một yêu cầu cụ thể. Trong nguồn này, Qwen trình bày tổng số 125 tỷ tham số và 6 tỷ tham số hoạt động như một cách để theo đuổi công suất với khối lượng công việc hoạt động thấp hơn. Việc điều đó có nghĩa là chi phí thấp hơn, phản hồi nhanh hơn hay chất lượng tốt hơn không thể được kết luận chỉ từ nguồn.

Mô tả đa phương thức có thể làm cho mô hình phù hợp hơn các ứng dụng chỉ có văn bản. Tuy nhiên, “đa phương thức” không được định nghĩa thêm trong tài liệu được cung cấp. Không có danh sách loại đầu vào hoặc đầu ra, không có mô tả về ngôn ngữ hoặc phương tiện được hỗ trợ và không có bằng chứng về cách mô hình xử lý hình ảnh trong thế giới thực, hướng dẫn phức tạp hoặc nội dung nhạy cảm về an toàn. Các ví dụ về chim bồ nông được tạo chỉ cho thấy kết quả hình ảnh đã được thử trong dữ liệu khám phá được báo cáo.

Các phiên bản lượng tử hóa cũng rất quan trọng trên thực tế vì chúng biến kích thước và nhu cầu phần cứng của mô hình trở thành một phần của câu chuyện. Nguồn xác định các tệp có kích thước 72,5 và 78,9 gigabyte và cho biết chúng đã được thử nghiệm trên DGX Spark. Nó không cho biết liệu các nhà phát triển bình thường có thể chạy chúng hay không, họ yêu cầu bao nhiêu bộ nhớ khi hoạt động hoặc chất lượng thay đổi như thế nào khi lượng tử hóa. Những thiếu sót đó sẽ hạn chế những gì có thể suy luận một cách có trách nhiệm về khả năng tiếp cận.

Interactive Mechanism

Cơ chế tương tác: Nó thực sự hoạt động như thế nào

Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Kiểm tra khái niệm tương tác+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Xem gì tiếp theo

Những ẩn số quan trọng bao gồm ngày phát hành, giấy phép, phương thức được hỗ trợ, kết quả điểm chuẩn, yêu cầu phần cứng, đánh giá an toàn và điều kiện truy cập của mô hình. Cần phải thử nghiệm thêm để xác định xem liệu thiết kế tham số hoạt động được báo cáo có mang lại những lợi thế nhất quán cho khối lượng công việc thực tế hay không và liệu các phiên bản lượng tử hóa có duy trì được khả năng của mô hình hay không.

Ưu tiên hàng đầu là xác nhận các điều khoản phát hành chính thức. Người đọc và nhà phát triển cần biết liệu Qwen3.8-Flash-Next có thể tải xuống chính thức hay không, trọng lượng và định dạng nào được cung cấp, giấy phép nào được áp dụng và liệu việc sử dụng được phép cho mục đích thương mại hay chỉ cho nghiên cứu. Không có điều kiện nào trong số đó được nêu trong nguồn được cung cấp.

Đánh giá độc lập nên kiểm tra tuyên bố hiệu suất của nguồn. Việc theo dõi hữu ích sẽ so sánh cấu hình 6 tỷ tham số hoạt động với các mô hình trọng lượng mở khác về hiểu biết đa phương thức, tạo, lý luận, mã hóa và các tác vụ ngữ cảnh dài, đồng thời báo cáo phần cứng, cài đặt lượng tử hóa và độ trễ. Nguồn hiện tại không cung cấp sự so sánh có kiểm soát như vậy.

Hồ sơ an toàn và độ tin cậy của mô hình cũng vẫn chưa được biết. Không có phát hiện nào của đội đỏ, kiểm tra từ chối, đo lường ảo giác, phân tích quyền riêng tư hoặc biện pháp bảo vệ sử dụng sai mục đích xuất hiện trong tài liệu. Trước khi hệ thống được sử dụng trong các cài đặt tiếp theo, các nhà phát triển sẽ cần bằng chứng về các chế độ lỗi trên cả đầu vào văn bản và hình ảnh, cùng với hướng dẫn rõ ràng về đánh giá của con người.

Cuối cùng, kết nối Qwen4 phải được coi là một bản xem trước kiến ​​trúc hơn là một lời hứa về bản phát hành trong tương lai. Nguồn tin cho biết mô hình xem trước kiến ​​trúc được sử dụng trong Qwen4, nhưng nó không đưa ra lịch trình, thông số kỹ thuật hoặc đảm bảo rằng dòng cuối cùng sẽ phù hợp với mô hình này. Việc tiếp tục thử nghiệm có thể làm rõ liệu các cấu hình lượng tử hóa và thiết kế tham số hoạt động được báo cáo có phải là các tính năng bền vững hay các lựa chọn mang tính thăm dò hay không.

Hướng dẫn và câu hỏi liên quan

Giải thích về mô hình AIMáy biến ápĐào tạo AIChatGPT & LLMKiểm tra những gì bạn biết — thử một bài kiểm tra AI miễn phíTra cứu một thuật ngữ AI trong bảng thuật ngữ của chúng tôiTheo dõi trình theo dõi phát hành mô hình AI

Cập nhật và sửa chữa

Câu chuyện kinh điển này được cập nhật tại chỗ khi sự kiện đang phát triển có thay đổi cơ bản. URL và ngày xuất bản ban đầu của nó không bao giờ thay đổi.

  • Nguồn chính Qwen bổ sung một cách quan trọng các chi tiết về kiến ​​trúc và thử nghiệm cho mục phát hành Qwen3.8-Flash-Next hiện có: nó mô tả mô hình này như một bản xem trước MoE đa phương thức cho Qwen4, cung cấp tổng cộng 125 tỷ và 6 tỷ tham số hoạt động, đồng thời xác định các phiên bản lượng tử hóa 72,5 gigabyte và 78,9 gigabyte được thử nghiệm trên DGX Spark.
  • Blockchain.News cải thiện đáng kể sự kiện phát hành Qwen3.8-Flash-Next được thể hiện bằng bản cập nhật chuẩn. Nó báo cáo việc phát hành trọng lượng mở 176 tỷ tham số, mô tả Gated DeltaNet và Qwen Sparse Chú ý cho các bối cảnh lên tới 1 triệu mã thông báo, trích dẫn số liệu thông lượng của Alibaba và báo cáo xác thực NVIDIA trên GB300 NVL72. Những chi tiết này không được xác nhận độc lập trong nguồn được cung cấp.
  • Điều này thúc đẩy đáng kể sự kiện tiếp tục Qwen3.8-Flash đủ điều kiện: Investing.com báo cáo rằng Alibaba đã phát hành mô hình Qwen3.8-Flash sản xuất với trọng lượng có thể tải xuống, giá QwenCloud, điểm chuẩn được báo cáo và yêu cầu chi phí, đồng thời phát hành bản xem trước Qwen3.8-Flash-Next được liên kết với kiến ​​trúc Qwen4 theo kế hoạch của nó.
  • Decrypt bổ sung thêm báo cáo về bản xem trước Qwen 3.8-Flash-Next theo kế hoạch tương tự được bao gồm trong bản cập nhật chuẩn. Nó cho biết nhóm Qwen của Alibaba đã lên kế hoạch phát hành vào thứ Tư, mô tả mô hình này như một bản xem trước đa phương thức của Qwen 4 và báo cáo rằng điểm chuẩn và trọng lượng trực tiếp vẫn chưa có. Con số tổng cộng 125 tỷ và 6 tỷ tham số hoạt động được báo cáo vẫn chưa được xác minh trong tài liệu được cung cấp.
Xem nhật ký chỉnh sửa công khai
Tìm thấy điều này hữu ích?