什麼是非結構化資料?

非結構化資料是指不遵循預先定義格式、模式或結構的資訊。無法整齊地放入資料列和資料欄。因此,使用傳統的關聯式資料庫管理系統 (RDBMS) 儲存、處理及分析這類資料會相當困難。每天都會有自由格式的資訊流入業務系統。請思考這對企業架構的影響:

  • 占企業儲存空間的大部分:這類資料實際上占企業目前收集的所有資訊約 70% 至 90%
  • 包含日常檔案類型:您經常使用的文字檔案、電子郵件、影片、圖片、音訊錄音和社群媒體貼文,都屬於非結構化資料。
  • 對現代架構造成挑戰:隨著應用程式規模擴大,如何處理大量不同資料成為開發人員和系統架構師的首要任務

管理非結構化資料的主要難題為何?

各產業的非結構化資料來源快速增加,帶來一些特殊的架構難題:

  • 大量資料生成:現代應用程式會持續生成電子郵件、PDF、IoT 感應器串流、監控影片片段、社群媒體內容、語音錄音和衛星圖像。使用者建立的內容規模可達 TB 和 PB 等級,而且會迅速累積。
  • 傳統資料庫的缺點:RDBMS 是專為結構化表格型資料打造,無法有效儲存、建立索引或查詢自由格式的資料。
  • 效能和成本風險:如果嘗試將影片檔案或原始感應器串流強制匯入標準 SQL 資料表,應用程式的效能可能會降低,費用則會增加。

如何擷取、儲存及瞭解這類非結構化資訊,是現代資料架構必須解決的核心問題。

非結構化資料有哪些特徵?

非結構化資料的關鍵特點是沒有預先定義的資料模式。資料格式多元,包括文字、圖片、影片、音訊和 IoT 遙測資料。與乾淨的試算表資料不同,這類資訊通常會累積成 PB 規模的龐大資料量。這類資料複雜多變,而且不斷變化。

處理這些自由格式的檔案需要完全不同的技術方法,原因如下:

  • 傳統資料庫的不足之處:非結構化資料完全沒有固定格式,因此標準 SQL 資料庫無法以原生方式讀取或查詢這類資料
  • SQL 有明顯的限制:您無法撰寫簡單的 SQL 指令,找出客服通話的整體情緒,或識別相片中的特定物件
  • 需要專用工具:組織必須仰賴專用解決方案,才能理解這些資訊
  • AI 驅動分析:團隊使用人工智慧、機器學習和自然語言處理技術,從混亂中掃描、解讀和擷取價值

對比這些格式,有助於瞭解它們如何相互組合。結構化資料依賴 SQL、強制執行嚴格的結構定義,且容易搜尋。非結構化資料沒有結構定義,難以原生搜尋,需要資料湖泊或 NoSQL 資料庫解決方案。JSON 或 XML 等半結構化資料則介於兩者之間,雖然包含一些組織標記,但沒有嚴謹的關聯式結構定義。

資料類型

資料模型

儲存空間

查詢方法

範例

數量分布

結構化資料

預先定義的嚴格結構定義

關聯資料庫

SQL

財務記錄、庫存

中等程度

半結構化資料

彈性、自述式

NoSQL、文件儲存庫

NoSQL API、SQL 擴充功能

JSON、XML、CSV

不斷增加

非結構化資料

沒有預先定義的模式

資料湖泊、物件儲存庫、NoSQL


AI、機器學習、自然語言處理、搜尋索引

文字、影片、圖片、音訊

占比達 85% 至 90%


資料類型

資料模型

儲存空間

查詢方法

範例

數量分布

結構化資料

預先定義的嚴格結構定義

關聯資料庫

SQL

財務記錄、庫存

中等程度

半結構化資料

彈性、自述式

NoSQL、文件儲存庫

NoSQL API、SQL 擴充功能

JSON、XML、CSV

不斷增加

非結構化資料

沒有預先定義的模式

資料湖泊、物件儲存庫、NoSQL


AI、機器學習、自然語言處理、搜尋索引

文字、影片、圖片、音訊

占比達 85% 至 90%


運用 Google Cloud 處理非結構化資料

如要建構合適的資料管道,確切瞭解您處理的資訊類型,以及企業團隊實際上如何使用 Google Cloud 資料庫管理資料,會很有幫助。非結構化資料可分為兩大類:人為產生和機器產生。

人類生成的非結構化資料

這些都是使用者和員工每天手動建立的內容。

  • 文字文件和通訊內容:在許多應用程式中,非結構化資料可能以大量電子郵件、即時通訊訊息和客服支援單的形式存在
  • 用途:開發人員可以建構自然語言處理 (NLP) 管道,其中原始支援單存放在 Cloud Storage。接著,Gemini Enterprise Agent Platform 會掃描文字,找出核心問題,系統則會將這些新產生的結構化標記直接儲存到 Firestore 資料庫。Firestore 可即時同步資料,因此內部網頁應用程式會即時更新,將緊急錯誤直接轉送給合適的工程團隊。
  • 互動式多媒體:包括客服中心的音訊檔案、使用者上傳的圖片和錄影內容
  • 用途:如果您要建構保險應用程式,就需要一種方法來處理使用者從手機上傳的車禍照片。您可以將這些大型檔案儲存在 Cloud Storage,使用機器學習模型估算外觀損壞程度,然後將結構化的維修估價儲存在 AlloyDB for PostgreSQL 資料庫。這有助於讓標準企業應用程式快速可靠地存取 AI 結果。

機器生成的非結構化資料

電腦、感應器和伺服器會在背景產生大量資料,不需要任何人為輸入。

  • IoT 感應器資料和遙測資料:工廠機器、智慧恆溫器和聯網汽車會持續串流原始資料。這些原始遙測資料大多以複雜的巢狀結構和自由格式呈現。
  • 用途:製造工廠每秒串流數百萬個原始音訊和感應器事件。由於標準關聯資料表無法處理這種擷取速度,因此開發人員會使用 Bigtable。Bigtable 能吸收這類高處理量的時間序列資料,不會發生延遲。接著,機器學習模型會讀取這些資料,找出零件故障時發出的特定聲音,藉此在機器實際故障前觸發預測性維護。
  • 衛星圖像和監控影片:監視攝影機和氣象衛星會持續產生大量影像資料。
  • 用途:一間全球航運公司產生大量原始衛星影片串流。該公司以符合成本效益的方式將這些龐大的檔案儲存在 Cloud Storage,並使用電腦視覺技術辨識貨船,然後將這些結構化的位置更新推送至 Spanner。這能為該公司的全球供應鏈應用程式提供高準確度、零停機時間的關聯式資料庫,以供查詢即時追蹤資訊。

儲存非結構化資料:資料湖泊與企業資料倉儲

若要建構可擴充的應用程式,開發人員可為資料選擇合適的儲存環境。結構化和非結構化資料需要完全不同的架構,才能維持效能並將基礎架構成本控制在合理範圍。

對於結構化資料,組織會仰賴企業資料倉儲 (EDW)。這個環境專門用於處理符合嚴格規則和可預測格式的資訊。

  • 您可以使用企業資料倉儲,集中管理多個關聯資料庫中的結構化資訊,包括帳單系統和客戶關係工具
  • 團隊必須先清理資料並調整格式,再行儲存,確保每筆資訊都能準確填入預先定義的資料表
  • 商業智慧工具接著就能在幾秒內對數十億列資料執行複雜的 SQL 查詢,提供可靠的歷來報表和預測

非結構化資料則需要更靈活的處理方式。由於影片、錄音和原始文字記錄等大型檔案無法整齊地放入表格,開發人員會使用資料湖泊和 Cloud Storage bucket 來存放這些檔案。

  • 資料湖泊提供彈性的存放區,可讓您以原生原始格式儲存檔案,而不必先將檔案強制套入特定結構
  • Cloud Storage bucket 採用物件儲存空間支援這些資料湖泊,讓系統能擴充至 PB 級容量,且無需重建資料庫
  • 在傳統資料庫中儲存大型非結構化檔案的成本極高,因此在處理大量資料時,Storage bucket 是更符合成本效益的選擇
  • 讓資料維持原始格式,人工智慧和機器學習管道就能輕鬆提取所需檔案,用於訓練電腦視覺和自然語言處理模型

常見問題

以下針對開發人員和架構師經常提出的非結構化資料問題提供解答。

常見範例包括電子郵件、社群媒體貼文、PDF、音訊或影片檔案等由人類產生的內容。您也會看到機器產生的格式,例如衛星圖像和 IoT 感應器遙測資料。這些形式多樣、格式自由的資料,占了企業日常資料的絕大部分,無法整齊地整理成標準資料庫的列和欄。


CSV 檔案通常被視為結構化或半結構化資料,因為這類檔案使用資料列、資料欄和一致的分隔符號。CSV 檔案雖然不強制執行嚴格的關聯式結構定義,但表格格式讓資料相當井然有序。因此,CSV 檔案的結構化程度遠高於影片、圖片或任意形式文字等真正的非結構化資料。


SQL 是用於結構化關聯式資料的標準查詢語言,而不是資料類型本身。SQL 會依賴嚴格的結構定義和資料表來擷取資訊。因此,如未經過額外處理或擴充,SQL 無法直接查詢非結構化資料,例如圖片、音訊或任意形式文字。

非結構化資料的特徵是沒有預先定義的資料模型。如果資訊無法整齊地放入資料列和資料欄,且無法直接使用 SQL 查詢,則可能屬於非結構化資料。實務指標包括電子郵件和聊天記錄等文字格式,以及影片、圖片、音訊和感應器資料等非文字格式。


電子郵件的實際內文是非結構化資料,因為內文是由任意形式的文字組成,沒有固定結構定義。不過,寄件者、收件者、時間戳記和主旨行等相關中繼資料則為結構化資料。這種雙重性質非常普遍,這也是為什麼組織會使用 NLP 和 AI,從電子郵件內容中大規模擷取洞察資訊。



結構化資料依賴固定結構定義,並儲存在使用 SQL 資料表的關聯式資料庫中。半結構化資料包含一些組織元素,但缺乏嚴格的結構定義,常見例子包括 JSON、XML 和 CSV 檔案。非結構化資料沒有預先定義的格式,包括影片和自由格式文字等檔案,占企業資料的絕大部分。

分析非結構化資料有哪些好處?

如果能解鎖隱藏在文字、圖片和影片中的資訊,貴機構將能獲得巨大優勢。以下列舉為非結構化資料賦予結構的幾項主要優點:

更深入的客戶洞察:

傳統資料庫會記錄顧客購買的商品。非結構化資料則可協助說明原因。分析社群媒體貼文、產品評論和客戶支援通話,即可評估情緒並確切瞭解使用者需求,進而打造真正能解決其問題的產品。

提升作業效率:

您可以將手動工作自動化,節省時間和資源。自然語言處理工具可以讀取收到的支援電子郵件,並立即將郵件轉送至正確的部門。此外,這類工具還能掃描內容繁複的法律合約,自動擷取重要日期和條款。

主動式風險管理:

公司必須保護私密資料,但要在龐大的資料湖泊中找出個人資訊並不容易。機器學習模型可快速掃描數百萬份任意形式的文件和圖片,找出並保護私密資料。這有助於貴公司遵守嚴格的隱私權法律。

預測性維護與監控:

AI 模型可分析非結構化事件記錄和 IoT 感應器串流,找出人類可能忽略的細微模式。舉例來說,AI 模型能辨識出代表機器即將故障的確切音訊頻率。這樣您就能在設備故障前進行維修,減少代價高昂的停機時間。

更強大的 AI 和機器學習模型:

AI 模型需要大量資訊才能學習並改進。只要為模型提供圖片、音訊、任意形式文字等各種非結構化資料,模型就能更全面地瞭解現實世界。這能訓練模型生成更準確可靠的預測結果。

AI 和機器學習技術如何發揮非結構化資料的價值

如要從這些複雜的檔案中挖掘出有意義的價值,您需要專用的框架。人工智慧和機器學習技術可做為這個程序的引擎。舉例來說,AI 輔助自動化管道可協助將影片檔案或原始文字文件,從龐大的二進位程式碼區塊轉換為可讀取的資料。

開發人員會運用特定 AI 技術處理不同類型的檔案,包括:

  • 自然語言處理:讀取電子郵件、支援單和法律合約等文字密集的文件
  • 電腦視覺:分析圖片和影片,協助執行多項工作,例如查看監控錄影畫面、評估醫學影像或處理衛星相片
  • 語音轉文字模型:轉錄音訊檔案,讓文字可供搜尋

以下說明現代 AI 管道如何處理這類資訊,進而提供實際的解決方案:

  1. 收集非結構化來源:使用者、裝置和應用程式會不斷產生原始資料。常見範例包括文字密集的電子郵件、影片檔案、IoT 感應器串流、PDF 和社群媒體貼文。
  2. 透過擷取層轉送:系統會安全地收集傳入的資料,並轉送至正確的儲存目的地。開發人員通常會使用大量資料管道、API 閘道或批次檔案上傳功能,在不拖慢主要應用程式的情況下移動這些資料。
  3. 在儲存層保護資料:系統會根據您需要存取資料的速度和頻率,安全地保存資訊。您可以使用 Cloud Storage 建構原始資料湖泊、使用 Bigtable 處理高速 IoT 記錄檔,或使用 Firestore 存放彈性的應用程式內容。
  4. 在處理層分析:AI 模型可在此發揮作用。專門的運算模型會運用上述自然語言處理、電腦視覺和語音轉文字工具,讀取、掃描及解讀不拘格式的檔案,從中找出意義。
  5. 提供洞察層:最後,系統會將處理後的資料轉化為清楚明確、可據以行動的商業智慧。最終可獲得多項寶貴的輸出內容,例如從客服中心錄音檔得出的顧客情緒分數、為符合法規而自動分類的文件,以及從工廠感應器取得的預測性維護快訊。
  6. 持續回饋並最佳化:可信度偏低的 AI 預測結果會轉送給人工審查員驗證及修正。這些剛修正過的資料會做為新的訓練資料回饋至步驟 1,用於重新訓練並改善 AI 模型。系統會持續追蹤模型的準確率和延遲時間,確保 AI 不會隨著時間推移而衰退。

選擇合適的非結構化資料管理解決方案

選擇管理解決方案時,應考量具體工作負載和成長軌跡。您可以先比較地端部署檔案儲存空間與雲端物件儲存庫。隨著複雜度增加,選擇通常會轉向雲端原生資料湖泊或全代管 AI 整合平台。

評估選項時,請參考這份技術檢查清單:

  • 儲存空間架構 (檔案式、物件儲存庫或資料湖泊)
  • 可擴充至 PB 規模,且符合成本效益
  • 原生 AI 和機器學習整合 (NLP、電腦視覺、嵌入)
  • NoSQL 彈性 (Bigtable 適用於處理量密集的工作負載,Firestore 適用於應用程式層級內容)
  • 資料治理、存取控管和法規遵循功能
  • 支援多種格式 (文字、圖片、影片、音訊、IoT)
  • 與現有資料倉儲、商業智慧工具和分析平台整合
  • 目標資料量的總持有成本

專門打造的非結構化儲存功能

隨著人工智慧工作負載增加,儲存空間不再只是被動的資料儲存庫。儲存空間已成為 AI 效能路徑上的主動元件。為消除開發人員和資料庫管理員遇到的基礎架構效能瓶頸,Google Cloud 推出了多項進階非結構化儲存空間功能。

如果您要設計高效能的資料架構,可以運用下列特定工具,大規模處理及管理非結構化格式:

  • 智慧儲存空間自動產生中繼資料:智慧儲存空間會在非結構化物件寫入 bucket 的當下,自動產生圖片註解等相關背景資訊。這麼一來,開發人員就完全不必再自行建構手動註解管道。此外,這項服務也整合 Model Context Protocol (MCP) 伺服器,讓 AI 代理能原生讀取、寫入及分析 Cloud Storage 資料。
  • 非結構化資料的洞察:這項 Knowledge Catalog 功能會使用 Gemini Enterprise Agent Platform,分析資料湖泊中儲存的 PDF 等原始非結構化檔案的實際內容。這項服務會自動推論結構定義並擷取關係,直接將非結構化檔案編入 BigQuery 物件資料表,方便您立即查詢。
  • Cloud Storage Rapid:這系列儲存空間專為應對 AI 處理作業的突發尖峰而設計,可提供極高的頻寬和極低的延遲。Rapid Bucket 提供超過 15 TB/s 的頻寬,而 Rapid Cache 可將讀取處理量提升至 2.5 TB/s,加快模型載入等密集型工作的速度,且現有 bucket 無須變更任何程式碼。
  • Managed Lustre:如果基礎架構團隊正在建構大規模訓練叢集,Google Cloud Managed Lustre 現在可透過遠端直接記憶體存取 (RDMA) 技術,提供高達 10 TB/s 的處理量。這可確保高效能運算加速器能持續取得所需資料,不會發生延遲。
  • Z4M 執行個體:對於正在建構自訂儲存空間架構的組織而言,新的 Z4M 執行個體支援信任的平行檔案系統,每個執行個體最多可配置 168 TiB 的本機 SSD 容量。

只要使用這些專門打造的儲存工具,就能確保底層基礎架構輕鬆支援現代代理應用程式所需的龐大處理量和高並行性。



展開下一步行動

運用價值 $300 美元的免費抵免額和超過 20 項一律免費的產品,開始在 Google Cloud 中建構產品與服務。