公司指南

資料區塊

Databricks 是一個資料和人工智慧平台,它將資料工程、分析和機器學習統一在一個「lakehouse」基礎上。

閱讀時間約2分鐘最後更新

概述

It matters because it lets companies manage huge datasets and build AI directly where their data already lives.

深入探討

Databricks 於 2013 年由 Apache Spark 的原始創建者(包括來自加州大學柏克萊分校 AMPLab 的 Ali Ghodsi 和 Matei Zaharia)創立。其標誌性理念是「lakehouse」——將資料湖廉價、靈活的儲存與資料倉儲的可靠性和效能相結合,並透過開放的 Delta Lake 表格式實現。頂部是用於治理的 Unity Catalog、用於實驗追蹤的 MLflow 以及基於 Spark 構建的 Databricks Runtime。 2023 年,Databricks 收購了 MosaicML,隨後發布了開放式大型語言模型 DBRX,標誌著向生成式 AI 的硬轉向。該平台現在銷售一個“數據智慧平台”,用於在企業數據上建立和服務人工智慧代理。

技術洞察

Databricks 的核心是在 Apache Spark 上執行分散式運算,將大型作業分散到機器叢集上。 Delta Lake 在廉價的物件儲存之上添加了 ACID 事務和事務日誌,因此資料湖的行為就像資料庫一樣可靠。 MLflow 標準化了 ML 生命週期—追蹤運行、打包模型和管理部署。對於生成人工智慧,Mosaic AI 工具可以處理微調、向量搜尋和模型服務,讓公司可以直接針對受管理的資料建立檢索增強助理。

戰略影響

供應商策略

供應商路線圖會影響您的團隊接下來可以建立的功能。

成本與預算

商業條款和部署選項會影響長期成本和風險。

風險與安全

公司激勵措施塑造了產品預設、安全態勢和開放性。

資料區塊的未來

Databricks 正在競相成為企業基於自己的資料建立人工智慧的地方,與 Snowflake 和雲端巨頭競爭。預計人工智慧代理、受控檢索和允許非專家以自然語言查詢資料的工具將獲得大量投資。它的開源賭注(Delta Lake、MLflow、DBRX)旨在鎖定思想份額,同時實現服務和治理的貨幣化。憑藉極高的私募估值和穩定的 IPO 猜測,Databricks 將 Lakehouse 定位為企業生成人工智慧的預設基底。

現實世界的實施

一家零售商每晚在 Databricks 上執行 Spark 作業,將數十億銷售記錄處理到乾淨的表中以進行預測。

資料科學團隊使用 Databricks 上的 MLflow 來追蹤實驗並部署流失預測模型。

一家銀行使用 Mosaic AI 向量搜尋建立了一個受監管的聊天機器人,可以回答有關內部政策文件的問題。

分析小組使用 Delta Lake 為混亂的資料湖提供可靠的 BI 儀表板事務表。

風險與防護欄

發佈公告可能會超過實際生產工作流程的穩定性。

API 定價或政策轉變可能會在一夜之間打破假設。

單一供應商依賴性增加了鎖定和遷移成本。

實施路線圖

1

使用您自己的任務和資料集評估提供者。

2

在整合之前查看隱私、安全和法律條款。

3

維護跨模型或供應商的後備計劃。

4

監控發行說明,以便路線圖的變更不會讓團隊感到意外。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Databricks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常見問題

What is Databricks?

Databricks 是一個資料和人工智慧平台,它將資料工程、分析和機器學習統一在一個「lakehouse」基礎上。這很重要,因為它可以讓公司管理龐大的資料集,並直接在資料已經存在的地方建立人工智慧。

Databricks 是由哪個開源專案的原始創建者創立的?

Databricks 由加州大學柏克萊分校 AMPLab 的 Apache Spark 創建者於 2013 年創立。

「湖屋」建築結合了什麼?

湖屋將靈活、廉價的湖儲存與倉庫級的可靠性和速度融為一體。

哪種開放式表格式為 Databricks 資料湖提供 ACID 事務?

Delta Lake 在便宜的物件儲存之上添加了交易日誌和 ACID 保證。

Databricks 上的 MLflow 有何用途?

MLflow 標準化了追蹤運行、打包模型和管理部署。

哪種收購和開放模式標誌著 Databricks 轉向生成式 AI?

Databricks於2023年收購了MosaicML,並發布了開放的DBRX模型,標誌著其對生成式AI的推動。