發生了什麼事
研究人員推出了 SAGE(自適應生成執行),這是將 AI 功能整合到 SQL 系統中的框架。該論文將 AI 操作分為三種類型的原語:用於單一行的 AI_SCALAR、用於群組的 AI_AGG 以及用於行對之間關係的 AI_JOIN。報告稱,SAGE 提高了測試工作負載的執行品質和效率,其中一項代表性可分解連接的成本降低了 358 倍。
本文從資料庫軟體的實際變化開始:SQL 系統越來越多地暴露用於分類、提取、過濾、排名、檢索、連接和摘要的人工智慧功能。儘管這些函數具有不同的名稱和接口,但作者認為它們的關係行為可以圍繞著三個角色進行組織。 AI_SCALAR 轉換各個行,AI_AGG 組合跨組的信息,AI_JOIN 確定行對之間的關係。 SAGE 為這些角色提供了通用的邏輯表示,同時允許執行策略根據操作的形狀而有所不同。該組織是本文描述人工智慧操作如何適應關係查詢的主要方式。原語區分操作是作用於一行、一組行或成對關係,而框架將這些情況保留在共享執行模型中。
一個核心功能是由三個原語共享的置信門控執行介面。消息人士稱,該介面與針對標量、聚合和連接工作負載量身定制的實體策略相結合。該論文特別關注 AI_JOIN,其中天真地評估每個可能對的基於模型的謂詞可能會創建大量模型呼叫。 SAGE 分析謂詞,在可能的情況下分解複合條件,並使用配方卡和小型無標籤探針在完整的執行策略中進行選擇。這意味著框架不僅關心人工智慧函數回傳什麼,還關心資料庫如何執行相應的工作。邏輯角色決定關係任務的類型,物理策略決定該任務的執行方式。對於連接,規定的目標是避免在可以分解謂詞時將每個候選對視為需要相同的直接評估。
在摘要中,該論文報告了對公共人工智慧營運商的廣泛審計和跨標量、聚合和連接工作負載的評估的結果。它表示,SAGE 實現了最強的整體 SemBench 性能,並且對於代表性的可分解連接,將成對模型呼叫減少了兩個數量級以上。報告的結果是測量成本降低了 358 倍。這些是作者在 2026 年 8 月 21 日提交的 arXiv 論文中提出的主張;提供的來源不建立同行評審、獨立複製或生產部署。邏輯原語及其物理策略之間的差異對於報告的結果非常重要:本文為不同的操作提供了一個通用組織,然後評估對應工作負載類型的執行行為。來源的摘要將最大的聲明節省與可因子連接案例聯繫起來,而不是將該數字呈現為每個支援人工智慧的 SQL 查詢的通用結果。
為什麼這很重要
AI 函數可能會使資料庫查詢變得更加昂貴,因為它們可能需要對許多行或行對重複模型呼叫。 SAGE 將這些呼叫視為查詢規劃的一部分,可能為資料庫工程師提供一種更系統化的方法來減少不必要的推理,同時保留有用的結果。報告的研究結果來自預印本,並未確定生產可靠性、廣泛的成本節約或所有模型和資料集的性能。
隨著公司將基於模型的操作置於資料管道內,操作問題變得越來越重要。傳統的資料庫查詢通常依賴相對可預測的運算成本,而人工智慧功能可能涉及昂貴的推理、可變的延遲和不確定的輸出品質。當操作將許多記錄相互比較時,潛在模型呼叫的數量可能會迅速增長。因此,了解人工智慧功能的關係角色的查詢規劃器可能會影響人工智慧資料工作的成本和回應能力。
SAGE 提出的抽象化可能很有用,因為它將 AI 推理與已建立的資料庫概念聯繫起來,而不是將每個模型呼叫視為孤立的應用程式級任務。分離行轉換、組級操作和成對關係可以讓系統重複使用普通的關係規劃技術,同時選擇專門的模型推理策略。如果報告的連接結果適用於更廣泛的設置,則表明在控制人工智慧工作負載成本時,謂詞結構與模型速度一樣重要。
公共意義仍然受到所提供的證據的限制。來源報告了作者的審計和評估的改進,但它沒有提供詳細的基準表、數據集、模型身份、硬體配置、基線定義、延遲測量或抽象的貨幣假設。它還沒有表明 SAGE 提高了每個工作負載的答案品質。模型呼叫的大量減少可能很有價值,但結果必須與召回率、精確度、失敗案例以及任何額外規劃或探測的成本一起評估。
互動機制:它實際上是如何運作的
以互動方式探索這項發展背後的基礎技術。
A route planner searches possible journeys using explicit rules. What does this illustrate about AI?
接下來看什麼
接下來重要的問題是,SAGE 的概括是否超出了論文的評估範圍,其收益在多大程度上取決於可分解謂詞,以及其置信門和無標記探針對於不同的模型和數據是否仍然可靠。獨立複製、實施可用性以及對生產規模資料庫的測試將有助於確定該方法是否已準備好實際採用。
第一個測試是再現性。研究人員和資料庫開發人員將需要存取實施、評估程式碼、工作負載定義和足夠的配置詳細信息,以重複報告的 SemBench 並加入實驗。如果沒有這些材料,358 倍的數字是一個有用的研究主張,但不是一般的性能預期。消息來源沒有說明代碼或資料是否可用。
第二個問題是泛化。 SAGE 報告的最大收益來自代表性可分解連接,這表明謂詞的結構很重要。目前尚不清楚該框架如何處理不可分解的連接、不明確的自然語言謂詞、傾斜的數據、變化的分佈或具有不同成本和錯誤模式的模型。目前還不清楚小型無標記探針多久能夠正確預測哪種完整的執行策略最有效。
第三個問題是品質控制。置信門控執行可能有助於避免不必要的調用,但消息來源沒有具體說明如何校準置信度、如何顯示錯誤,或者當模型不確定或確信錯誤時會發生什麼。未來的評估應該報告品質成本權衡、尾部延遲、分佈變化的穩健性以及敏感數據的行為。生產採用還需要對審計模型決策進行明確的控制,並在使用人工智慧功能時保留普通的 SQL 保證。