Quay lại Tin tức
Đổi mớiAI Understanding tóm tắt

Bài báo GRIN đề xuất học tăng cường để đưa kiến thức liên tục vào các mô hình ngôn ngữ

Một bài báo arXiv mới đề xuất Golden-GRPO Insert, một khung tự học gồm ba giai đoạn nhằm giúp các mô hình ngôn ngữ lớn tiếp thu kiến thức mới được đưa vào và áp dụng nó qua các diễn giải, tài liệu kết hợp và nhiệm vụ lý luận.

6 min readRead the primary source
Primary-source image accompanying GRIN paper proposes reinforcement learning for continual knowledge injection in language models
Tài liệu nguồn chínhNguồn đã ghi
Nhà xuất bản
arxiv.org
Liên kết nguồn
arxiv.orghttps://arxiv.org/abs/2608.25243
Loại nguồn
Tài liệu chính - một thông báo chính thức, giấy tờ, hồ sơ hoặc trang của bên thứ nhất mà chúng tôi đọc trực tiếp.
Bối cảnhHiểu điều này trong 60 giây

Bắt đầu ở đây

Thuật ngữ chính

Học tăng cường
Đào tạo bằng các tín hiệu khen thưởng trong đó nhân viên học các hành động nhằm tối đa hóa lợi nhuận dài hạn.
Tinh chỉnh
Tiếp tục đào tạo về dữ liệu theo miền cụ thể để điều chỉnh mô hình được đào tạo trước cho phù hợp với một nhiệm vụ cụ thể.
Độ bền
Khả năng của một mô hình để duy trì hiệu suất dưới tác động của tiếng ồn, sự dịch chuyển hoặc các yếu tố đầu vào đối nghịch.
Tự kiểm traCâu đố giải thích về mô hình AI

Chuyện gì đã xảy ra

Các nhà nghiên cứu Zhibo Hou, Fan Zhao, Zhiyu An và Wan Du đề xuất Golden-GRPO Tiêm, hay GRIN, một khuôn khổ tự học ba giai đoạn để liên tục bổ sung kiến ​​thức cho các mô hình ngôn ngữ lớn. Thành phần trung tâm của nó, Golden-GRPO, là một phương pháp học tập củng cố chính sách hỗn hợp cung cấp câu trả lời tham khảo khi nỗ lực chính sách của mô hình không thành công đối với một thực tế mới. Bài viết giới thiệu hai điểm chuẩn ở cấp độ tài liệu, Trống và Bộ đếm, để kiểm tra việc tiếp thu kiến ​​thức mới và ghi đè phản thực tế. Các tác giả báo cáo rằng GRIN vượt trội hơn so với các cơ sở học tập củng cố chính sách hỗn hợp và tinh chỉnh có giám sát khác đối với các câu hỏi khó hơn trong khi khớp chúng với khả năng thu hồi dữ kiện cơ bản.

Nguồn là bản tóm tắt arXiv cho một bài báo được gửi vào ngày 26 tháng 8 năm 2026. Các tác giả cho rằng việc tiêm kiến ​​thức liên tục như một cách để giữ cho các mô hình ngôn ngữ lớn luôn cập nhật trong một môi trường thay đổi nhanh chóng. Họ lập luận rằng các phương pháp tinh chỉnh có giám sát hiện có có thể ghi nhớ các sự kiện được đưa vào ở định dạng dùng cho đào tạo nhưng có thể thất bại khi thông tin tương tự được diễn giải, kết hợp với các tài liệu khác hoặc được sử dụng trong lý luận. Do đó, bài viết tập trung vào việc liệu một mô hình có thể sử dụng thông tin mới một cách linh hoạt sau khi cập nhật chứ không chỉ lặp lại một thực tế trực tiếp hay không.

Hệ thống được đề xuất có tên là Golden-GRPO Tiêm, hay GRIN, và được mô tả là khung tự học ba giai đoạn. Thuật toán trung tâm của nó, Golden-GRPO, là một phương pháp học tập củng cố chính sách hỗn hợp được thiết kế để bổ sung kiến ​​thức. Theo bản tóm tắt, nó cung cấp một “câu trả lời vàng” như một tín hiệu học tập ngay cả khi việc triển khai chính sách không thành công vì một thực tế mới lạ. Về mặt thực tế, phương pháp này nhằm mục đích tránh chỉ dựa vào những nỗ lực thành công của chính mô hình khi kiến ​​thức được giới thiệu là mới và mô hình chưa biết cách trả lời chính xác.

Bài viết cũng giới thiệu hai tiêu chuẩn cấp độ tài liệu. Mục tiêu trống là việc mua lại tiểu thuyết, trong khi Counter nhắm mục tiêu ghi đè phản thực tế. Bản tóm tắt cho biết cả hai điểm chuẩn đều đánh giá ba khả năng: nhớ lại một sự kiện duy nhất, lấy thông tin từ nhiều nguồn và thực hiện suy luận suy luận. Cấu trúc này rất quan trọng vì nó tách việc thu hồi đơn giản khỏi các nhiệm vụ yêu cầu mô hình cập nhật để kết hợp thông tin hoặc rút ra câu trả lời. Nguồn không cung cấp quy mô, chủ đề, quy trình xây dựng hoặc ví dụ của điểm chuẩn.

Các tác giả báo cáo rằng việc học tăng cường chính sách hỗn hợp cho phép “hấp thụ kiến ​​thức” vượt xa những gì mà việc tinh chỉnh có giám sát có thể đạt được. Họ còn tuyên bố thêm rằng GRIN thực sự vượt trội hơn các cơ sở học tập củng cố chính sách hỗn hợp và tinh chỉnh có giám sát đối với các loại câu hỏi khó hơn, đồng thời phù hợp với các phương pháp đó về thu hồi dữ kiện cơ bản. Đây là những tuyên bố được đưa ra bởi các tác giả của bài báo. Nguồn được cung cấp không chứa điểm số, ước tính độ không đảm bảo, kết quả cắt bỏ hoặc thông tin chi tiết về mô hình và dữ liệu nào đã được sử dụng, do đó không thể đánh giá mức độ và độ chắc chắn của cải tiến được báo cáo chỉ từ bản tóm tắt.

Chi tiết nguồn: arxiv.org ↗

Tại sao nó quan trọng

Bài viết đề cập đến hạn chế thực tế của việc cập nhật mô hình ngôn ngữ: học một sự kiện theo dạng thức được sử dụng trong quá trình đào tạo không nhất thiết có nghĩa là áp dụng nó khi nhu cầu từ ngữ, tài liệu hoặc lý luận thay đổi. Nếu phương pháp được báo cáo khái quát hóa, nó có thể làm cho việc cập nhật mô hình trở nên hữu ích hơn bằng cách kiểm tra xem liệu kiến ​​thức mới được cung cấp có được tích hợp thay vì chỉ được ghi nhớ hay không. Nguồn không cung cấp xác nhận độc lập, kết quả chi tiết hoặc bằng chứng về việc triển khai, do đó, tầm quan trọng vẫn là tuyên bố nghiên cứu thực nghiệm hơn là khả năng sản xuất đã được thiết lập.

Vấn đề trọng tâm là sự khác biệt giữa việc ghi nhớ một tuyên bố mới được cung cấp và việc sử dụng thông tin đó như một phần của hành vi rộng hơn của mô hình. Một hệ thống chỉ trả lời khi được nhắc bằng cùng một từ ngữ được sử dụng trong quá trình đào tạo có thể kém hữu ích hơn một hệ thống có thể nhận dạng các cách diễn giải, kết nối các tài liệu và lý do riêng biệt với thông tin cập nhật. GRIN được thiết kế xoay quanh sự khác biệt đó, làm cho bài viết có liên quan trực tiếp đến cách duy trì các mô hình ngôn ngữ sau quá trình đào tạo ban đầu.

Đánh giá được đề xuất cũng chỉ ra một tiêu chuẩn khắt khe hơn đối với việc cập nhật mô hình. Việc thu hồi thông tin đơn lẻ có thể cho biết liệu một mục có được giữ lại hay không, nhưng việc truy xuất đa nguồn và suy luận suy luận sẽ kiểm tra xem thông tin có thể được truy cập và áp dụng trong các bối cảnh khác nhau hay không. Ghi đè phản thực tế đặc biệt liên quan đến việc cập nhật liên tục vì nó kiểm tra xem liệu một mô hình có thể thay thế phiên bản thông tin trước đó bằng phiên bản mới hay không. Nguồn không xác định mức độ đáng tin cậy mà GRIN thực hiện các hoạt động này, nhưng nó xác định các khả năng cụ thể mà các phương pháp cập nhật cần đo lường.

Nếu kết quả của tác giả phù hợp với các mô hình và tập dữ liệu, thì cách tiếp cận này có thể giảm khoảng cách giữa việc cập nhật hành vi được lưu trữ của mô hình và cho phép nó sử dụng kiến ​​thức mới được giới thiệu. Điều đó có thể quan trọng đối với các ứng dụng mà thông tin thay đổi và câu trả lời phụ thuộc vào việc kết hợp một số tài liệu được cung cấp. Tuy nhiên, nguồn mô tả khung nghiên cứu chứ không phải sản phẩm được phát hành hoặc triển khai. Nó không cho thấy GRIN hoạt động trong cài đặt vận hành thực tế, vẫn ổn định qua nhiều chu kỳ cập nhật hoặc tránh làm hỏng các khả năng không liên quan.

Cũng có những hạn chế quan trọng đối với các bằng chứng có sẵn ở đây. Bài gửi là bản in sẵn và tài liệu được cung cấp chỉ là văn bản và bản tóm tắt trên trang đích arXiv. Không có kết quả đánh giá ngang hàng nào được đưa ra và không có bản sao bên ngoài hoặc đánh giá độc lập nào được trích dẫn. Bản tóm tắt không xác định việc triển khai cơ sở, số lượng mô hình được đánh giá, loại kiến ​​thức được đưa vào hoặc cường độ thống kê của các so sánh. Những điều chưa biết đó có nghĩa là kết quả có thể là nghiên cứu hữu ích, nhưng chưa phải là một giải pháp chung được chứng minh là có thể duy trì các mô hình ngôn ngữ được triển khai hiện hành.

Interactive Mechanism

Cơ chế tương tác: Nó thực sự hoạt động như thế nào

Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Kiểm tra khái niệm tương tác+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Xem gì tiếp theo

Phần tiếp theo quan trọng nhất là bằng chứng đầy đủ đằng sau những lợi ích được báo cáo của GRIN: thành phần điểm chuẩn, mô hình và chi tiết đào tạo, kết quả bằng số, so sánh với các phương pháp cập nhật mạnh mẽ hơn và hiệu suất trên kiến ​​thức không được tác giả lựa chọn. Cũng không rõ nguồn gốc về cách thức phương pháp xử lý các tài liệu xung đột hoặc không chính xác, tần suất ghi đè phản thực tế thành công như thế nào, liệu cách tiếp cận này có vô tình làm thay đổi kiến ​​thức đã học trước đó hay không và liệu mã hoặc dữ liệu chuẩn có được phát hành hay không.

Toàn bộ bài viết cần làm rõ ba giai đoạn của GRIN làm gì và Golden-GRPO kết hợp các chính sách của mình như thế nào. Nó cũng phải cho biết tín hiệu trả lời tham chiếu được tạo ra, lựa chọn hay chuẩn bị theo cách khác vì độ tin cậy và chi phí của tín hiệu đó có thể ảnh hưởng đến việc sử dụng thực tế. Thông tin chi tiết về thời gian đào tạo, yêu cầu tính toán và số lượng ví dụ cập nhật sẽ giúp xác định xem phương pháp này có khả thi ngoài thử nghiệm được kiểm soát hay không.

Các điểm chuẩn đảm bảo kiểm tra chặt chẽ. Người đọc nên tìm kiếm các lĩnh vực được trình bày trong Blank và Counter, cách tách các sự kiện mới khỏi dữ liệu đào tạo trước đó, cách xây dựng các câu hỏi đa nguồn và cách tính điểm các câu trả lời suy luận. Điều quan trọng nữa là phải xem liệu lợi ích được báo cáo có còn tồn tại dưới các cách diễn giải và kết hợp tài liệu không liên kết chặt chẽ với các ví dụ đào tạo hay không. Phần tóm tắt thiết lập các bài kiểm tra dự định nhưng không cung cấp đủ thông tin để đánh giá mức độ hoặc độ khó của chúng.

Việc ghi đè phản thực tế đặt ra một câu hỏi riêng về độ tin cậy: việc thay đổi một phần kiến ​​thức có thể gây ra những thay đổi ngoài ý muốn ở nơi khác. Nguồn không cho biết liệu các tác giả có đo lường việc lưu giữ các sự kiện không liên quan, xung đột giữa các tài liệu, cập nhật lặp lại hoặc đảo ngược thông tin trước đó hay không. Những thử nghiệm đó sẽ giúp phân biệt việc cập nhật kiến ​​thức có kiểm soát với một phương pháp chỉ đơn giản là cải thiện hiệu suất trên một tập hợp hẹp các ví dụ được đưa vào.

Cuối cùng, công việc tiếp theo sẽ xác định liệu các phát hiện có lặp lại trên các mô hình ngôn ngữ và các loại kiến ​​thức hay không. Nguồn không đề cập đến mã, kế hoạch phát hành điểm chuẩn, điểm kiểm tra mô hình công khai hoặc người dùng trong thế giới thực. Nó cũng không nêu rõ cách thức phương pháp xử lý các câu trả lời tham chiếu không chính xác hoặc thông tin mới được đưa vào xung đột với các tài liệu khác. Cho đến khi những câu hỏi đó được trả lời, kết luận rõ ràng nhất vẫn còn hạn chế: bài báo báo cáo một hướng thử nghiệm đầy hứa hẹn để đánh giá và đào tạo các cập nhật kiến ​​thức liên tục, với lợi thế được khẳng định mạnh nhất của nó là xuất hiện trong các nhiệm vụ khó hơn, không cần nhớ lại.

Hướng dẫn và câu hỏi liên quan

Giải thích về mô hình AIĐào tạo AIMáy biến ápTương lai của AIKiểm tra những gì bạn biết — thử một bài kiểm tra AI miễn phíTra cứu một thuật ngữ AI trong bảng thuật ngữ của chúng tôiTheo dõi trình theo dõi phát hành mô hình AI
Tìm thấy điều này hữu ích?