HƯỚNG DẪN KỸ THUẬT

Q-Học

Q-Learning là một thuật toán học tăng cường dạy cho tác nhân những hành động nào mang lại kết quả tốt nhất bằng cách học dần dần giá trị của mỗi bước di chuyển thông qua thử và sai.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

It matters because it can find optimal behavior without ever being told the rules of its environment.

Lặn sâu

Q-Learning học một hàm gọi là Q(s, a): phần thưởng dài hạn dự kiến ​​khi thực hiện hành động 'a' ở trạng thái 's' và sau đó hành động tối ưu sau đó. Người đại diện bắt đầu không biết gì, thử hành động và quan sát phần thưởng. Sau mỗi bước, nó sẽ điều chỉnh ước tính giá trị Q của mình đối với phần thưởng vừa nhận được cộng với giá trị tương lai được chiết khấu tốt nhất mà nó mong đợi ở trạng thái tiếp theo. Điều quan trọng là nó 'phi chính sách' và 'không có mô hình': nó có thể tìm hiểu chính sách tốt nhất trong khi khám phá một cách ngẫu nhiên và nó không bao giờ cần một mô hình về cách thế giới chuyển đổi. Khi đã khám phá đủ mọi cặp hành động trạng thái, các giá trị Q có thể hội tụ về giá trị tối ưu và hành động tốt nhất ở bất kỳ trạng thái nào chỉ đơn giản là hành động có Q cao nhất.

Hiểu biết kỹ thuật

Cốt lõi là bản cập nhật Bellman: Q(s,a) <- Q(s,a) + alpha[r + gamma*max_a' Q(s',a') - Q(s,a)]. Alpha là tốc độ học tập, gamma là hệ số chiết khấu tính đến các phần thưởng trong tương lai và số hạng trong ngoặc là sai số chênh lệch theo thời gian. Mức 'tối đa' cho các hành động tiếp theo là điều khiến nó không có chính sách và cho phép nó tìm hiểu chính sách tối ưu tham lam ngay cả khi đang khám phá. Việc thăm dò thường được xử lý bằng lựa chọn hành động tham lam của epsilon.

Tác động chiến lược

Chi phí và ngân sách

Các quyết định về kiến ​​trúc sẽ thúc đẩy hiệu suất và chi phí vận hành trong nhiều năm.

Quyết định rõ ràng hơn

Giáo dục kỹ thuật giúp các nhóm chọn nhóm phù hợp chứ không chỉ nhóm mới nhất.

Kiểm soát chất lượng

Lựa chọn kỹ thuật tốt hơn làm giảm sự cố về độ tin cậy trong sản xuất.

Tương lai của Q-Learning

Q-Learning dạng bảng cổ điển gặp khó khăn khi có quá nhiều trạng thái để lưu trữ trong một bảng. Hướng chủ yếu là kết hợp nó với các mạng thần kinh, như trong Deep Q-Networks (DQN), xấp xỉ các giá trị Q từ các đầu vào thô như pixel. Nghiên cứu tiếp tục ổn định điều này bằng tính năng phát lại trải nghiệm, mạng mục tiêu và các biến thể như Double DQN và Q-Learning phân phối nhằm giảm sai lệch đánh giá quá cao và thể hiện phân phối lợi nhuận đầy đủ thay vì mức trung bình đơn lẻ.

Triển khai trong thế giới thực

Đại lý chơi trò chơi Atari (DQN của DeepMind) học cách chơi Breakout và Pong trực tiếp từ pixel màn hình

Tối ưu hóa thời gian đèn giao thông tại các nút giao thông để giảm thiểu tổng thời gian chờ xe

Điều hướng rô-bốt thông qua lưới hoặc mê cung nơi rô-bốt học đường đi ngắn nhất để tối đa hóa phần thưởng

Các quyết định về giá và hàng tồn kho linh hoạt trong đó đại lý tìm hiểu hành động nào tối đa hóa lợi nhuận dài hạn

Rủi ro & lan can

Tối ưu hóa một điểm chuẩn có thể che giấu những điểm yếu của hệ thống rộng hơn.

Chi phí cơ sở hạ tầng và bảo trì thường được đánh giá thấp.

Khoảng cách về bảo mật và khả năng quan sát có thể tăng lên khi hệ thống trở nên phức tạp hơn.

Lộ trình thực hiện

1

Xác định các mục tiêu về độ trễ, chất lượng và chi phí trước khi triển khai.

2

Điểm chuẩn trong điều kiện tải và dữ liệu thực tế.

3

Giám sát thiết bị về lỗi, độ lệch và tác động của người dùng.

4

Chuẩn bị đường dẫn khôi phục và ứng phó sự cố trước khi mở rộng quy mô.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Q-Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Lập kế hoạch tỷ lệ học tập

Câu hỏi thường gặp

What is Q-Learning?

Q-Learning là một thuật toán học tăng cường dạy cho tác nhân những hành động nào mang lại kết quả tốt nhất bằng cách học dần dần giá trị của mỗi bước di chuyển thông qua thử và sai. Nó quan trọng vì nó có thể tìm ra hành vi tối ưu mà không cần phải biết các quy tắc của môi trường.

Giá trị Q Q(s, a) đại diện cho điều gì?

Q(s, a) ước tính tổng phần thưởng được chiết khấu trong tương lai từ việc thực hiện hành động a ở trạng thái s và hành xử tối ưu sau đó, chứ không chỉ là phần thưởng trước mắt.

Tại sao Q-Learning được mô tả là 'ngoài chính sách'?

Tối đa các hành động tiếp theo có nghĩa là Q-Learning tìm hiểu giá trị của chính sách tối ưu tham lam ngay cả khi tác nhân khám phá bằng chính sách hành vi khác.

Trong quy tắc cập nhật, hệ số chiết khấu gamma kiểm soát điều gì?

Gamma (từ 0 đến 1) giảm giá các phần thưởng trong tương lai; các giá trị gần 1 làm cho tác nhân có tầm nhìn xa, các giá trị gần 0 làm cho tác nhân bị cận thị.

Lỗi chênh lệch thời gian (TD) trong Q-Learning là gì?

Lỗi TD là khoảng cách giữa ước tính mục tiêu mới (phần thưởng cộng với giá trị tương lai được chiết khấu tốt nhất) và ước tính Q cũ; bản cập nhật thu hẹp khoảng cách này.

Tại sao Q-Learning dạng bảng đơn giản lại gặp khó khăn với các vấn đề lớn như trò chơi điện tử từ pixel?

Bảng tra cứu cần một mục nhập cho mỗi cặp hành động trạng thái, điều này không khả thi khi số lượng trạng thái lên tới hàng tỷ, thúc đẩy các công cụ xấp xỉ mạng thần kinh như DQN.