Quay lại Tin tức
Đổi mớiAI Understanding tóm tắt

Thời báo Đông Bắc báo cáo khoảng cách hiệu suất lớn về điểm chuẩn của 18 mô hình mã hóa AI

Điểm chuẩn Prime Intellect được báo cáo bởi Northeast Times đã thử nghiệm 18 mô hình AI trên 153 tác vụ mã hóa tự động. Claude Opus 5 dẫn đầu với tỷ lệ hoàn thành 81,7%, trong khi Kimi K3 đạt 52,2% và GPT-5.6 Sol đạt 35,9%. Báo cáo cho biết việc đánh giá cũng cho thấy những khác biệt lớn về hiệu quả quy trình làm việc, cách sử dụng công cụ và…

5 min readRead the linked source
Source-page capture accompanying Northeast Times reports wide performance gap in benchmark of 18 AI coding models
Nguồn tham khảoNguồn đã ghi
Nhà xuất bản
northeasttimes.com
Liên kết nguồn
northeasttimes.comhttps://northeasttimes.com/2026/08/24/new-benchmark-ranks-18-ai-coding-models-and-the-gap-is-stark/
Loại nguồn
Nguồn được liên kết - trạng thái nguồn chính chưa được thiết lập.
Bối cảnhHiểu điều này trong 60 giây

Bắt đầu ở đây

Thuật ngữ chính

Điểm chuẩn
Một bài kiểm tra hoặc tập dữ liệu được tiêu chuẩn hóa dùng để đo lường và so sánh hiệu suất của mô hình.
Bộ nhớ (Bộ nhớ tác nhân)
Bối cảnh được lưu trữ mà tác nhân AI sử dụng qua các bước hoặc phiên để cải thiện tính liên tục.
suy luận
Giai đoạn chạy trong đó mô hình được đào tạo tạo ra dự đoán hoặc kết quả đầu ra.
Tự kiểm traCâu đố giải thích về mô hình AI

Chuyện gì đã xảy ra

Theo tờ Northeast Times, NanoGPT Speedrun của Prime Intellect đã đánh giá 18 mô hình AI trong 153 bài kiểm tra yêu cầu mỗi hệ thống tối ưu hóa một trình huấn luyện mô hình ngôn ngữ nhỏ mà không cần sự trợ giúp của con người. Claude Opus 5 đã hoàn thành 81,7% điểm chuẩn, tiếp theo là Kimi K3 với 52,2% và GPT-5.6 Sol ở mức 35,9%. Báo cáo cho biết Prime Intellect cũng đã công bố 41 quỹ đạo tác nhân được theo dõi cho thấy cách các mô hình sử dụng các công cụ, bộ nhớ và API bên ngoài. Các kết quả cơ bản của điểm chuẩn chưa được xác minh độc lập tại đây.

Thời báo Đông Bắc đưa tin rằng NanoGPT Speedrun của Prime Intellect đã đặt 18 mô hình AI thông qua 153 bài kiểm tra độc lập. Mỗi bài kiểm tra yêu cầu một mô hình tối ưu hóa trình huấn luyện mô hình ngôn ngữ nhỏ một cách tự động mà không cần sự trợ giúp của con người. Nguồn trình bày đây là thước đo khả năng mã hóa và gỡ lỗi được duy trì lâu dài chứ không phải là một bài tập tạo mã đơn giản. Báo cáo được cung cấp liên kết đến trang điểm chuẩn của Prime Intellect, nhưng phương pháp điểm chuẩn và kết quả thô không được xác nhận độc lập trong đánh giá này.

Thứ hạng được báo cáo là không đồng đều. Thời báo Đông Bắc cho biết Claude Opus 5 đã hoàn thành 81,7% bộ phần mềm, trong khi Kimi K3 hoàn thành 52,2% và GPT-5.6 Sol hoàn thành 35,9%. Claude Sonnet 5, GPT-5.6 Luna và Grok 4.5 được cho là đã giảm trong khoảng 20% ​​đến 26%. DeepSeek V4 Pro, Muse Spark 1.2 và GPT-5.5 được báo cáo dưới 15%. Những số liệu này được cho là của báo cáo của tờ Northeast Times và không được coi là điểm số được kiểm toán độc lập.

Nguồn tin cho biết việc đánh giá đã theo dõi nhiều hơn tỷ lệ hoàn thành cuối cùng. Thời báo Đông Bắc báo cáo rằng các hệ thống mạnh hơn đã đạt đến ngưỡng chính xác với ít bước tối ưu hóa hơn và dung lượng bộ nhớ nhỏ hơn, trong khi các hệ thống yếu hơn thường chạy lâu hơn mà không có sự cải thiện đáng kể. Báo cáo gán cách giải thích này cho Hyper.ai, mô tả lỗ hổng năng lực liên quan đến việc tạo mã nhiều bước và khôi phục lỗi. Tài liệu được cung cấp không cung cấp các phép đo cơ bản, khoảng tin cậy hoặc kết quả chi tiết theo từng nhiệm vụ.

Thời báo Đông Bắc cũng đưa tin rằng Prime Intellect đã công bố 41 quỹ đạo tác nhân được truy tìm đầy đủ. Những bản ghi này được cho là hiển thị các lệnh gọi công cụ, kiểu phân bổ bộ nhớ, quy trình xử lý lỗi, lý luận trên bảng ghi nhớ và tương tác với các API bên ngoài. Nguồn cho biết các hệ thống hoạt động tốt nhất đã sử dụng ủy quyền tác nhân phụ có cấu trúc và lệnh gọi công cụ có hệ thống, trong khi các hệ thống yếu hơn đôi khi đi vào vòng lặp đệ quy hoặc ngừng cải thiện sớm. Bài báo không xác định liệu tất cả 18 mô hình có nhận được ngân sách giàn giáo, khả năng truy cập công cụ hoặc suy luận giống hệt nhau hay không.

Chi tiết nguồn: northeasttimes.com ↗

Tại sao nó quan trọng

Sự lan truyền được báo cáo cho thấy rằng việc lựa chọn mô hình có thể ảnh hưởng đáng kể đến độ tin cậy của quy trình mã hóa tự động. Kết quả cũng chỉ ra tầm quan trọng của việc thiết kế tác nhân, sử dụng công cụ và khắc phục lỗi, không chỉ kích thước mô hình hay khả năng tiêu đề. Đối với các tổ chức đang xem xét việc tái cấu trúc tự động, tạo cơ sở hạ tầng hoặc tích hợp liên tục, việc đánh giá mã hóa có thể tái tạo có thể mang lại nhiều thông tin hơn so với các bản trình diễn riêng lẻ. Các phát hiện vẫn bị hạn chế bởi thiết kế nhiệm vụ của điểm chuẩn và do thiếu xác nhận độc lập trong tài liệu được cung cấp.

Các kết quả được báo cáo rất quan trọng vì các hệ thống mã hóa tự động ngày càng được đánh giá bằng việc liệu chúng có thể hoàn thành công việc gồm nhiều bước hay không chứ không chỉ đơn thuần là tạo ra các đoạn mã hợp lý. Một mô hình có thể phục hồi sau lỗi, quản lý công cụ và tiếp tục hướng tới mục tiêu có thể hữu ích hơn mô hình hoạt động tốt trên các lời nhắc riêng biệt. Thời báo Đông Bắc kết nối điểm chuẩn với các mục đích sử dụng của doanh nghiệp như tái cấu trúc tự động, tích hợp liên tục và tạo cơ sở hạ tầng, mặc dù bài viết không ghi lại các hoạt động triển khai cụ thể hoặc đo lường kết quả kinh doanh.

Quy mô của khoảng cách hiệu suất được báo cáo thách thức giả định rằng sự khác biệt giữa mô hình mã hóa là không đáng kể. Theo số liệu được tờ Northeast Times trích dẫn, Claude Opus 5 đã hoàn thành nhiều nhiệm vụ hơn đáng kể so với các hệ thống được xếp hạng tiếp theo và gấp hơn 5 lần tỷ lệ của cấp có hiệu suất thấp nhất. Sự so sánh đó có thể quan trọng đối với các tổ chức lựa chọn một mô hình, nhưng nó vẫn cụ thể đối với tiêu chuẩn này. Nó không chứng minh rằng một mô hình chung tốt hơn trên các ngôn ngữ lập trình, kho lưu trữ, tác vụ bảo mật hoặc môi trường sản xuất.

Điểm chuẩn cũng nêu bật sự khác biệt giữa khả năng của mô hình và cấu hình hệ thống. Northeast Times cho biết những hệ thống hoạt động hiệu quả nhất dựa vào việc ủy ​​quyền có tổ chức và sử dụng công cụ, trong khi các hệ thống yếu hơn có thể lặp lại hoặc hội tụ quá sớm. Nếu chính xác, điều đó có nghĩa là điểm số của mô hình có thể phản ánh một phần việc khai thác tác nhân, lời nhắc, công cụ và giới hạn tài nguyên xung quanh. Bài viết không tiết lộ đủ chi tiết về cấu hình để xác định mức độ xếp hạng đến từ các mô hình cơ bản và mức độ đến từ thiết lập hoạt động của chúng.

Tính minh bạch có thể giúp việc đánh giá trở nên hữu ích hơn so với một bảng xếp hạng duy nhất nếu các nhà phát triển bên ngoài có thể kiểm tra và tái tạo dấu vết. Thời báo Đông Bắc mô tả 41 quỹ đạo là bằng chứng chi tiết bất thường về cách các mô hình hoạt động thông qua các nhiệm vụ mã hóa. Những hồ sơ như vậy có thể giúp xác định các dạng lỗi và cải thiện việc kiểm tra. Tuy nhiên, việc xuất bản dấu vết không tự nó chứng minh rằng điểm chuẩn mang tính đại diện, rằng các nhiệm vụ không được điều chỉnh cho phù hợp với các hệ thống cụ thể hoặc các kết quả khái quát hóa ngoài bộ được báo cáo.

Interactive Mechanism

Cơ chế tương tác: Nó thực sự hoạt động như thế nào

Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Kiểm tra khái niệm tương tác+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Xem gì tiếp theo

Các câu hỏi chính là liệu các tác vụ NanoGPT Speedrun có đại diện cho công việc kỹ thuật phần mềm thực sự hay không, liệu xếp hạng có phù hợp với các cơ sở mã và ngôn ngữ khác hay không và liệu các kết quả có thể được sao chép bởi những người đánh giá bên ngoài hay không. Các nhà phát triển nên kiểm tra các dấu vết đã xuất bản và các mô hình thử nghiệm trên kho lưu trữ của riêng họ trước khi coi điểm số là hướng dẫn triển khai. Các đánh giá trong tương lai sẽ báo cáo chi phí, độ trễ, mức độ nghiêm trọng của lỗi và yêu cầu đánh giá của con người cùng với tỷ lệ hoàn thành.

Vấn đề đầu tiên cần xem là khả năng tái tạo. Nguồn tin cho biết Prime Intellect đã cung cấp sẵn 41 quỹ đạo tác nhân, nhưng không cho biết liệu bộ nhiệm vụ hoàn chỉnh, mã tính điểm, phiên bản mô hình, lời nhắc, quyền công cụ và giới hạn tài nguyên có được công khai hay không. Việc chạy lại độc lập bằng cách sử dụng các điều kiện tương tự sẽ giúp xác định liệu thứ hạng được báo cáo có ổn định hay không chứ không phải là thành phần của một thiết lập đánh giá.

Vấn đề thứ hai là giá trị bên ngoài. Tối ưu hóa một trình huấn luyện mô hình ngôn ngữ nhỏ có thể kiểm tra các kỹ năng hữu ích trong việc gỡ lỗi, thử nghiệm và lặp lại liên tục, nhưng nó không giống như việc duy trì một cơ sở mã sản xuất lớn. Các so sánh trong tương lai nên bao gồm các thử nghiệm để đánh giá mã, quản lý phụ thuộc, lỗ hổng bảo mật, tài liệu, di chuyển dữ liệu và các thay đổi kho lưu trữ lâu dài. Báo cáo được cung cấp không hiển thị cách ánh xạ các tác vụ được đánh giá tới các cài đặt đó.

Chi phí và hiệu quả hoạt động cũng cần được xem xét kỹ lưỡng. Thời báo Đông Bắc báo cáo sự khác biệt trong các bước tối ưu hóa và mức sử dụng bộ nhớ, nhưng nó không cung cấp giá cả, độ trễ, tổng mức sử dụng mã thông báo, mức tiêu thụ năng lượng hoặc chi phí khắc phục lỗi. Một mô hình có tỷ lệ hoàn thành cao hơn có thể không phải là lựa chọn kinh doanh tốt hơn nếu nó đắt hơn đáng kể hoặc cần có sự xem xét kỹ lưỡng của con người. Những biện pháp thực tế đó phải đi kèm với điểm số trên bảng xếp hạng trong tương lai.

Cuối cùng, các tổ chức nên coi kết quả là tín hiệu sàng lọc thay vì đảm bảo triển khai. Thời báo Đông Bắc trích dẫn một kiến ​​trúc sư doanh nghiệp cho biết hội nhập là vấn đề trọng tâm, nhưng quan điểm đó là bình luận hơn là bằng chứng độc lập. Các nhóm nên kiểm tra các hệ thống ứng cử viên dựa trên kho lưu trữ của chính họ, xác định các chế độ lỗi có thể chấp nhận được và yêu cầu xem xét trước khi mã được đưa vào sản xuất. Kết luận của điểm chuẩn có thể thay đổi khi các mô hình, giàn giáo và nhiệm vụ đánh giá phát triển.

Hướng dẫn và câu hỏi liên quan

Giải thích về mô hình AIĐại lý AIĐào tạo AIPrompt EngineeringKiểm tra những gì bạn biết — thử một bài kiểm tra AI miễn phíTra cứu một thuật ngữ AI trong bảng thuật ngữ của chúng tôiTheo dõi trình theo dõi phát hành mô hình AI
Tìm thấy điều này hữu ích?