Đồ thị suy luận và lõi Seldon
Seldon Core là một nền tảng nguồn mở để triển khai các mô hình machine learning trên Kubernetes, với tính năng nổi bật: đồ thị suy luận.
Tổng quan
Instead of serving one isolated model, it lets you chain models, routers, combiners, and transformers into a single directed graph that runs as one deployable service.
Lặn sâu
Nhiều trường hợp sử dụng sản xuất thực tế liên quan đến nhiều hơn một lệnh gọi mô hình. Bạn có thể xử lý trước dữ liệu đầu vào, định tuyến yêu cầu đến một trong nhiều mô hình, chạy một tổ hợp và sau đó xử lý hậu kỳ kết quả. Seldon Core thể hiện điều này dưới dạng biểu đồ suy luận được xác định trong SeldonDeployment (hoặc, trong kiến trúc v2, thông qua Seldon Core Operator và MLServer). Biểu đồ được xây dựng từ các loại thành phần có thể tái sử dụng: Mô hình phục vụ dự đoán, Máy biến áp sửa đổi đầu vào hoặc đầu ra, Bộ định tuyến quyết định nên gọi thành phần con nào (cho phép thử nghiệm A/B và kẻ cướp nhiều nhánh) và Bộ kết hợp tổng hợp đầu ra từ nhiều mô hình để tập hợp. Seldon hỗ trợ nhiều khung thông qua các máy chủ đóng gói sẵn và trình bao bọc Python tùy chỉnh, đồng thời hiển thị các số liệu phong phú, theo dõi phân tán và đăng xuất tải trọng ra khỏi hộp để có thể quan sát và giải thích.
Hiểu biết kỹ thuật
Biểu đồ suy luận là một biểu đồ tuần hoàn có hướng trong đó mỗi nút là một vi dịch vụ có giao diện dự đoán tiêu chuẩn và người điều phối của Seldon (người điều phối/thực thi dịch vụ) định tuyến một yêu cầu thông qua biểu đồ và hợp nhất các phản hồi. Bởi vì Bộ định tuyến có thể triển khai logic kẻ cướp nhiều nhánh nên lưu lượng truy cập có thể chuyển đổi thích ứng sang các mô hình hoạt động tốt hơn dựa trên tín hiệu phần thưởng trực tiếp. Seldon Core v2 tách biểu đồ khỏi các máy chủ mô hình riêng lẻ bằng MLServer và Giao thức suy luận mở, cho phép phân phối nhiều mô hình và cam kết vượt mức trên phần cứng dùng chung.
Tác động chiến lược
Chi phí và ngân sách
Các quyết định về kiến trúc sẽ thúc đẩy hiệu suất và chi phí vận hành trong nhiều năm.
Quyết định rõ ràng hơn
Giáo dục kỹ thuật giúp các nhóm chọn nhóm phù hợp chứ không chỉ nhóm mới nhất.
Kiểm soát chất lượng
Lựa chọn kỹ thuật tốt hơn làm giảm sự cố về độ tin cậy trong sản xuất.
Tương lai của đồ thị suy luận và lõi Seldon
Seldon đang hướng tới các MLOps mô-đun, tập trung vào dữ liệu với thiết kế luồng dữ liệu và đường dẫn của Core v2, cùng với sự kết hợp chặt chẽ hơn với tính năng phát hiện sai lệch (Alibi Detect) và khả năng giải thích (Alibi Giải thích). Khi LLM và hệ thống tác tử trở thành biểu đồ tổng hợp của khả năng truy xuất, mô hình và công cụ, tính trừu tượng của biểu đồ suy luận sẽ ánh xạ một cách tự nhiên vào các quy trình công việc này. Mong đợi sự chú trọng nhiều hơn vào hiệu quả phân phối đa mô hình, phát trực tuyến và khả năng quan sát được tiêu chuẩn hóa để các hệ thống AI phức tạp, nhiều bước vẫn có thể gỡ lỗi và quản lý được trong quá trình sản xuất.
Triển khai trong thế giới thực
Người cho vay xâu chuỗi một Transformer mã hóa một lần các tính năng thành một nút mô hình, sau đó là Transformer định dạng điểm số, tất cả dưới dạng một SeldonDeployment.
Một công ty truyền thông sử dụng nút Bộ định tuyến chạy kẻ cướp nhiều nhánh để tự động gửi nhiều lưu lượng truy cập hơn đến bất kỳ mô hình đề xuất nào đang kiếm được phần thưởng nhấp chuột cao hơn.
Một nhóm tập hợp ba mô hình gian lận với nút Combiner để tính điểm trung bình trước khi trả lại một quyết định duy nhất cho người gọi.
Một công ty bảo hiểm được quản lý sẽ đính kèm nhật ký tải trọng của Seldon và bộ giải thích Alibi vào biểu đồ suy luận để mọi dự đoán có thể được truy tìm và giải thích cho quá trình kiểm tra.
Rủi ro & lan can
Tối ưu hóa một điểm chuẩn có thể che giấu những điểm yếu của hệ thống rộng hơn.
Chi phí cơ sở hạ tầng và bảo trì thường được đánh giá thấp.
Khoảng cách về bảo mật và khả năng quan sát có thể tăng lên khi hệ thống trở nên phức tạp hơn.
Lộ trình thực hiện
Xác định các mục tiêu về độ trễ, chất lượng và chi phí trước khi triển khai.
Điểm chuẩn trong điều kiện tải và dữ liệu thực tế.
Giám sát thiết bị về lỗi, độ lệch và tác động của người dùng.
Chuẩn bị đường dẫn khôi phục và ứng phó sự cố trước khi mở rộng quy mô.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Seldon Core and Inference Graphs quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
TensorRT và công cụ suy luận
Câu hỏi thường gặp
What is Seldon Core and Inference Graphs?
Seldon Core là một nền tảng nguồn mở để triển khai các mô hình machine learning trên Kubernetes, với tính năng nổi bật: đồ thị suy luận. Thay vì phục vụ một mô hình riêng biệt, nó cho phép bạn xâu chuỗi các mô hình, bộ định tuyến, bộ kết hợp và máy biến áp thành một biểu đồ có hướng duy nhất chạy như một dịch vụ có thể triển khai.
Tính năng xác định giúp phân biệt Seldon Core với máy chủ một mô hình là gì?
Seldon Core cho phép bạn kết hợp các mô hình, bộ định tuyến, bộ kết hợp và bộ biến áp thành một biểu đồ suy luận duy nhất được triển khai dưới dạng một dịch vụ.
Thành phần biểu đồ Seldon nào quyết định nút con nào sẽ gửi yêu cầu tới, cho phép thử nghiệm A/B?
Bộ định tuyến hướng các yêu cầu đến một trong các con của nó và có thể thực hiện các thử nghiệm A/B hoặc kẻ cướp nhiều nhánh.
Loại thành phần nào tổng hợp kết quả đầu ra từ nhiều mô hình để tổng hợp?
Bộ kết hợp hợp nhất các phản hồi của nhiều mô hình con thành một đầu ra duy nhất, đó là cách xây dựng các tập hợp.
Đồ thị suy luận Seldon có dạng cấu trúc đồ thị nào?
Biểu đồ suy luận Seldon là biểu đồ tuần hoàn có hướng trong đó mỗi nút là một dịch vụ vi mô có giao diện dự đoán tiêu chuẩn.
Trong Seldon Core v2, máy chủ và giao thức nào cho phép phân phát đa mô hình trên biểu đồ?
Core v2 tách biểu đồ khỏi các máy chủ mô hình bằng MLServer và Giao thức suy luận mở để phục vụ nhiều mô hình.