ในโลกของการวิเคราะห์ข้อมูลขนาดใหญ่ หรือที่เรียกกันว่า Big Data การจัดการกระบวนการตั้งแต่รับเข้าสู่ระบบจัดเก็บ ข้อมูลจนถึงขั้นตอนนำไปสร้างโมเดลปัญญาประดิษฐ์นั้น ถือเป็นความท้าทายหลักสำหรับองค์กรจำนวนมาก ด้วยขีดจำกัดของเครื่องมือแบบดั้งเดิมที่ไม่สามารถรวมเวิร์กโหลดด้านวิทยาศาสตร์ข้อมูล, วิศวกรรม dữ liệu และ Machine Learning เข้าไว้ด้วยกันได้อย่างราบรื่น Databricks จึงได้ถือกำเนิดขึ้นเพื่อเข้ามาปฏิวัติแนวคิดเหล่านี้ โดยเสนอแพลตฟอร์มครบวงจรบนคลาวด์ ที่ออกแบบมาโดยเฉพาะสำหรับการทำงานกับโครงสร้างพื้นฐานระดับ Enterprise
Databricks คืออะไร? สถาปัตยกรรม Lakehouse
หัวใจสำคัญที่ทำให้ Databricks แตกต่างจากคู่แข่งคือสถาปัตยกรรมการทำ “Lakehouse” ซึ่งเป็นการผสานข้อดีที่ดีที่สุดระหว่างเทคโนโลยี Data Warehouse (DW) แบบมี Schema กำหนดตายตัว กับ Object Storage พื้นฐานอย่าง Data Lakes ทำให้ผู้ใช้งานไม่จำเป็นต้องเลือกว่าจะใช้รูปแบบใด แต่ให้เลือกใช้วิธีที่มีประสิทธิภาพสูงสุดในการวิเคราะห์ ภายใต้รากฐานเดียวกัน สิ่งนี้ช่วยลดปัญหา