非結構化資料是指不遵循預先定義格式、模式或結構的資訊。無法整齊地放入資料列和資料欄。因此,使用傳統的關聯式資料庫管理系統 (RDBMS) 儲存、處理及分析這類資料會相當困難。每天都會有自由格式的資訊流入業務系統。請思考這對企業架構的影響:
各產業的非結構化資料來源快速增加,帶來一些特殊的架構難題:
如何擷取、儲存及瞭解這類非結構化資訊,是現代資料架構必須解決的核心問題。
非結構化資料的關鍵特點是沒有預先定義的資料模式。資料格式多元,包括文字、圖片、影片、音訊和 IoT 遙測資料。與乾淨的試算表資料不同,這類資訊通常會累積成 PB 規模的龐大資料量。這類資料複雜多變,而且不斷變化。
處理這些自由格式的檔案需要完全不同的技術方法,原因如下:
對比這些格式,有助於瞭解它們如何相互組合。結構化資料依賴 SQL、強制執行嚴格的結構定義,且容易搜尋。非結構化資料沒有結構定義,難以原生搜尋,需要資料湖泊或 NoSQL 資料庫解決方案。JSON 或 XML 等半結構化資料則介於兩者之間,雖然包含一些組織標記,但沒有嚴謹的關聯式結構定義。
資料類型 | 資料模型 | 儲存空間 | 查詢方法 | 範例 | 數量分布 |
結構化資料 | 預先定義的嚴格結構定義 | 關聯資料庫 | SQL | 財務記錄、庫存 | 中等程度 |
半結構化資料 | 彈性、自述式 | NoSQL、文件儲存庫 | NoSQL API、SQL 擴充功能 | JSON、XML、CSV | 不斷增加 |
非結構化資料 | 沒有預先定義的模式 | 資料湖泊、物件儲存庫、NoSQL | AI、機器學習、自然語言處理、搜尋索引 | 文字、影片、圖片、音訊 | 占比達 85% 至 90% |
資料類型
資料模型
儲存空間
查詢方法
範例
數量分布
結構化資料
預先定義的嚴格結構定義
關聯資料庫
SQL
財務記錄、庫存
中等程度
半結構化資料
彈性、自述式
NoSQL、文件儲存庫
NoSQL API、SQL 擴充功能
JSON、XML、CSV
不斷增加
非結構化資料
沒有預先定義的模式
資料湖泊、物件儲存庫、NoSQL
AI、機器學習、自然語言處理、搜尋索引
文字、影片、圖片、音訊
占比達 85% 至 90%
如要建構合適的資料管道,確切瞭解您處理的資訊類型,以及企業團隊實際上如何使用 Google Cloud 資料庫管理資料,會很有幫助。非結構化資料可分為兩大類:人為產生和機器產生。
這些都是使用者和員工每天手動建立的內容。
電腦、感應器和伺服器會在背景產生大量資料,不需要任何人為輸入。
若要建構可擴充的應用程式,開發人員可為資料選擇合適的儲存環境。結構化和非結構化資料需要完全不同的架構,才能維持效能並將基礎架構成本控制在合理範圍。
對於結構化資料,組織會仰賴企業資料倉儲 (EDW)。這個環境專門用於處理符合嚴格規則和可預測格式的資訊。
非結構化資料則需要更靈活的處理方式。由於影片、錄音和原始文字記錄等大型檔案無法整齊地放入表格,開發人員會使用資料湖泊和 Cloud Storage bucket 來存放這些檔案。
以下針對開發人員和架構師經常提出的非結構化資料問題提供解答。
常見範例包括電子郵件、社群媒體貼文、PDF、音訊或影片檔案等由人類產生的內容。您也會看到機器產生的格式,例如衛星圖像和 IoT 感應器遙測資料。這些形式多樣、格式自由的資料,占了企業日常資料的絕大部分,無法整齊地整理成標準資料庫的列和欄。
CSV 檔案通常被視為結構化或半結構化資料,因為這類檔案使用資料列、資料欄和一致的分隔符號。CSV 檔案雖然不強制執行嚴格的關聯式結構定義,但表格格式讓資料相當井然有序。因此,CSV 檔案的結構化程度遠高於影片、圖片或任意形式文字等真正的非結構化資料。
SQL 是用於結構化關聯式資料的標準查詢語言,而不是資料類型本身。SQL 會依賴嚴格的結構定義和資料表來擷取資訊。因此,如未經過額外處理或擴充,SQL 無法直接查詢非結構化資料,例如圖片、音訊或任意形式文字。
非結構化資料的特徵是沒有預先定義的資料模型。如果資訊無法整齊地放入資料列和資料欄,且無法直接使用 SQL 查詢,則可能屬於非結構化資料。實務指標包括電子郵件和聊天記錄等文字格式,以及影片、圖片、音訊和感應器資料等非文字格式。
電子郵件的實際內文是非結構化資料,因為內文是由任意形式的文字組成,沒有固定結構定義。不過,寄件者、收件者、時間戳記和主旨行等相關中繼資料則為結構化資料。這種雙重性質非常普遍,這也是為什麼組織會使用 NLP 和 AI,從電子郵件內容中大規模擷取洞察資訊。
結構化資料依賴固定結構定義,並儲存在使用 SQL 資料表的關聯式資料庫中。半結構化資料包含一些組織元素,但缺乏嚴格的結構定義,常見例子包括 JSON、XML 和 CSV 檔案。非結構化資料沒有預先定義的格式,包括影片和自由格式文字等檔案,占企業資料的絕大部分。
大多數企業架構最終都會超出單一儲存平台的負荷。隨著系統規模擴大,資料湖泊和 Storage bucket 自然會分散在不同區域和雲端服務供應商。當您嘗試建構需要一次存取所有非結構化檔案的機器學習 pipeline 時,這種分散的狀況會造成限制。
Google Cloud 透過代理式資料雲端解決這項特定的架構難題。這項服務提供 AI 原生跨雲端湖倉一體架構,可將分散的儲存環境連結至單一存取點。
如果能解鎖隱藏在文字、圖片和影片中的資訊,貴機構將能獲得巨大優勢。以下列舉為非結構化資料賦予結構的幾項主要優點:
更深入的客戶洞察:
傳統資料庫會記錄顧客購買的商品。非結構化資料則可協助說明原因。分析社群媒體貼文、產品評論和客戶支援通話,即可評估情緒並確切瞭解使用者需求,進而打造真正能解決其問題的產品。
提升作業效率:
您可以將手動工作自動化,節省時間和資源。自然語言處理工具可以讀取收到的支援電子郵件,並立即將郵件轉送至正確的部門。此外,這類工具還能掃描內容繁複的法律合約,自動擷取重要日期和條款。
主動式風險管理:
公司必須保護私密資料,但要在龐大的資料湖泊中找出個人資訊並不容易。機器學習模型可快速掃描數百萬份任意形式的文件和圖片,找出並保護私密資料。這有助於貴公司遵守嚴格的隱私權法律。
預測性維護與監控:
AI 模型可分析非結構化事件記錄和 IoT 感應器串流,找出人類可能忽略的細微模式。舉例來說,AI 模型能辨識出代表機器即將故障的確切音訊頻率。這樣您就能在設備故障前進行維修,減少代價高昂的停機時間。
更強大的 AI 和機器學習模型:
AI 模型需要大量資訊才能學習並改進。只要為模型提供圖片、音訊、任意形式文字等各種非結構化資料,模型就能更全面地瞭解現實世界。這能訓練模型生成更準確可靠的預測結果。
如要從這些複雜的檔案中挖掘出有意義的價值,您需要專用的框架。人工智慧和機器學習技術可做為這個程序的引擎。舉例來說,AI 輔助自動化管道可協助將影片檔案或原始文字文件,從龐大的二進位程式碼區塊轉換為可讀取的資料。
開發人員會運用特定 AI 技術處理不同類型的檔案,包括:
以下說明現代 AI 管道如何處理這類資訊,進而提供實際的解決方案:
選擇管理解決方案時,應考量具體工作負載和成長軌跡。您可以先比較地端部署檔案儲存空間與雲端物件儲存庫。隨著複雜度增加,選擇通常會轉向雲端原生資料湖泊或全代管 AI 整合平台。
評估選項時,請參考這份技術檢查清單:
隨著人工智慧工作負載增加,儲存空間不再只是被動的資料儲存庫。儲存空間已成為 AI 效能路徑上的主動元件。為消除開發人員和資料庫管理員遇到的基礎架構效能瓶頸,Google Cloud 推出了多項進階非結構化儲存空間功能。
如果您要設計高效能的資料架構,可以運用下列特定工具,大規模處理及管理非結構化格式:
只要使用這些專門打造的儲存工具,就能確保底層基礎架構輕鬆支援現代代理應用程式所需的龐大處理量和高並行性。