什么是非结构化数据?

所谓非结构化数据,是指那些不拘泥于预定义格式、模型或结构的信息。它无法整齐地存入行和列之中。因此,传统的关系型数据库管理系统 (RDBMS) 往往难以对其进行存储、处理和分析。它是每天源源不断涌入您业务系统的自由格式信息。以下是它对企业架构的影响:

  • 它占据了企业存储空间的绝大部分:这类数据实际上占到了企业如今收集的所有信息的约 70% 到 90%
  • 它包括日常文件类型:您在工作中经常会接触到这些数据,例如文本文件、邮件、视频、图片、录音/音频文件和社交媒体帖子。
  • 它对现代架构提出了挑战:随着应用规模的扩大,如何处理这些海量且异构的数据,成为开发者和系统架构师关注的焦点

管理非结构化数据面临哪些主要挑战?

在多个行业中,非结构化数据源都在迅猛增长,这给系统架构设计带来了一些独特的挑战:

  • 海量数据生成:现代应用无时无刻不在产生邮件、PDF 文档、物联网 (IoT) 传感器数据流、监控视频录像、社交媒体内容、音频录音以及卫星图像。用户创建的内容规模往往可达 TB 级甚至 PB 级,并且会迅速累积。
  • 传统数据库的局限性:RDBMS 专为结构化的表格数据而设计。它们根本无法对自由格式的数据进行高效的存储、索引或查询。
  • 性能和成本风险:如果您尝试将视频文件或原始传感器流强制存入标准 SQL 表中,应用的性能可能会下降,而成本则会增加。

如何捕获、存储和理解这些非结构化信息,是现代数据架构需要解决的核心问题。

非结构化数据有哪些特征?

非结构化数据的核心特征在于其缺乏预定义的数据模型。这类数据以多种多样的格式呈现,例如文本、图片、视频、音频和物联网 (IoT) 遥测数据。与规整的电子表格数据不同,这类信息通常会以 PB 级的海量规模不断累积。它结构复杂、高度可变,并且处于不断的动态变化中。

处理这些自由格式的文件需要采用截然不同的技术方案,这主要源于以下几个核心原因:

  • 传统数据库的不足之处:由于非结构化数据完全是自由格式,因此标准 SQL 数据库无法以原生方式读取或查询此类数据
  • SQL 有明显的局限性:您无法通过编写简单的 SQL 命令来了解客户服务通话的整体情绪,也无法识别照片中的特定对象
  • 需要专门的工具:为了解读这些信息,企业必须依赖专用解决方案
  • AI 驱动分析:团队使用人工智能、机器学习和自然语言处理技术,从庞杂混乱的数据中扫描、解读并提炼价值

通过对比这几种格式,您可以更清晰地了解它们之间的区别与联系。结构化数据依赖 SQL,强制执行严格的数据架构,并且非常便于检索和查询。非结构化数据没有固定的架构,很难以原生方式进行检索,因而需要数据湖或 NoSQL 数据库解决方案。介于两者之间的则是半结构化数据(例如 JSON 或 XML),这类数据包含一定的组织性标记,但缺乏严格的关系型架构。

数据类型

数据模型

存储

查询方法

示例

数据量分布

结构化数据

严格的预定义架构

关系型数据库

SQL

财务记录、库存

中

半结构化数据

灵活、自描述

NoSQL(文档存储区)

NoSQL API、SQL 扩展

JSON、XML、CSV

持续增长

非结构化数据

无预定义模型

数据湖、对象存储区、NoSQL


AI、机器学习、NLP、搜索索引

文本、视频、图片、音频

占据 85% 至 90% 的主导地位


数据类型

数据模型

存储

查询方法

示例

数据量分布

结构化数据

严格的预定义架构

关系型数据库

SQL

财务记录、库存

中

半结构化数据

灵活、自描述

NoSQL(文档存储区)

NoSQL API、SQL 扩展

JSON、XML、CSV

持续增长

非结构化数据

无预定义模型

数据湖、对象存储区、NoSQL


AI、机器学习、NLP、搜索索引

文本、视频、图片、音频

占据 85% 至 90% 的主导地位


使用 Google Cloud 处理非结构化数据

若要构建契合业务需求的数据流水线,您应当准确了解所处理的信息类型,以及企业团队实际如何利用 Google Cloud 数据库进行高效管理。您可以将非结构化数据划分为两大核心类别:人类生成的数据和机器生成的数据。

人工生成的非结构化数据

这些是您的用户和员工每天手动创建的内容示例。

  • 文本文件与通信:在许多应用场景中,非结构化数据通常以海量邮件、聊天消息和客户支持工单的形式呈现
  • 应用场景:开发者可以构建一个自然语言处理 (NLP) 流水线,将原始支持服务工单放入 Cloud Storage。随后,Gemini Enterprise Agent Platform 会对文本进行扫描以识别核心问题,系统随之会将这些新结构化的标签直接保存到 Firestore 数据库中。由于 Firestore 支持数据的即时同步,您的内部 Web 应用可实现实时更新,从而将紧急 Bug 直接分发路由至相应的工程团队。
  • 富媒体:包括呼叫中心的音频文件、用户上传的图片和视频录像。
  • 应用场景:如果您构建了一款保险应用,则需要一套能高效处理用户通过手机上传的车祸照片的方案。您可以将这些大型文件保存在 Cloud Storage 中,并使用机器学习模型评估其外观受损情况,最后将结构化的维修估算数据存储在 AlloyDB for PostgreSQL 数据库中。这有助于让您的标准企业级应用能够快速、可靠地获取 AI 结果。

机器生成的非结构化数据

电脑、传感器和服务器会在后台自动生成海量数据,无需任何人工干预。

  • IoT 传感器数据与遥测数据:工厂设备、智能温控器和联网汽车会持续不断地传输原始数据。这些原始遥测数据大多采用复杂、嵌套和自由形式的格式。
  • 应用场景:一家制造工厂每秒可传输数百万个原始音频与传感器事件。由于标准关系表无法承受这种数据接入速度,因此开发人员通常使用 Bigtable。Bigtable 能够无延迟地高效吸收这些高吞吐量的时间序列数据。随后,机器学习模型会读取这些数据,以识别出代表部件发生故障的特定声音,从而在设备发生实际故障之前触发预测性维护。
  • 卫星图像和监控视频:安全摄像头和气象卫星会生成大量连续的视觉数据流。
  • 应用场景:一家全球航运公司会产生庞大的原始卫星视频流。该公司可以经济高效地将这些庞大的文件存储在 Cloud Storage 中,使用计算机视觉识别货船,然后将这些结构化的位置更新推送到 Spanner。这有助于为其全球供应链应用提供具有高精准度、零停机时间的关系型数据库,以便快速查询实时追踪信息。

存储非结构化数据:数据湖与企业级数据仓库的对比

为了构建高可伸缩性的应用,开发者应根据其数据类型选择最匹配的存储环境。结构化数据与非结构化数据需要采用完全不同的底层架构,从而在保障卓越性能的同时将基础设施成本控制在合理范围内。

对于结构化数据,组织通常依赖于企业级数据仓库 (EDW)。该环境专为处理遵循严格规则和可预测格式的数据而设计。

  • 您可以使用企业级数据仓库,集中管理来自多个关系型数据库的结构化信息,包括您的账单系统与客户关系管理 (CRM) 工具
  • 您的团队必须在保存数据之前对其进行清理和格式化,确保每条信息都能完美契合预定义的表格
  • 随后,商业智能工具只需数秒即可对数十亿行数据运行复杂的 SQL 查询,从而提供可靠的历史报告和预测分析

非结构化数据则需要采用更为灵活的处理方式。由于视频、录音和原始文本日志等大型文件无法放入整齐的表格中,开发者会使用数据湖和云存储桶来存储这些文件。

  • 数据湖提供了一个高灵活性的存储库,支持您以原生、原始格式直接存储文件,而无需先对其进行强制性的结构化转换
  • Cloud Storage 存储桶使用对象存储为这些数据湖提供支持,让您的系统能够扩容到 PB 级容量,而无需重建数据库
  • 在传统数据库中存储大容量非结构化文件成本极其高昂;相比之下,当面对海量数据时,使用存储桶是更具性价比的选择
  • 以原始格式保留数据,意味着您的人工智能和机器学习流水线可以轻松提取所需文件,从而训练计算机视觉与自然语言处理 (NLP) 模型

常见问题解答

以下是开发者和架构师针对非结构化数据经常提出的常见问题解答。

常见示例包括邮件、社交媒体帖子、PDF 以及音频或视频文件等由人类创建的内容。此外,还包括机器生成的数据格式,例如卫星图像和 IoT 传感器遥测数据。这些复杂多样、自由格式的数据构成了日常企业数据的绝大部分,无法整齐地组织到标准数据库的行和列中。


CSV 文件通常被视为结构化或半结构化数据,因为它由行、列和一致的分隔符组织而成。尽管它缺乏严格的关系型架构强校验,但其表格格式使其高度有序。这使得 CSV 文件的结构化程度远高于视频、图片或自由格式文本等真正的非结构化数据。


SQL 是一种用于结构化关系型数据的标准查询语言,而非数据类型本身。它依赖严格的架构和表来检索信息。因此,如果不进行额外处理或使用扩展,它便无法原生查询图片、音频或自由格式文本等非结构化数据。

您可以通过非结构化数据缺少预定义数据模型的特征来识别此类数据。如果信息无法整齐地组织在行和列中,且您无法使用 SQL 直接进行查询,则其很可能属于非结构化数据。实际表现形式包括邮件和聊天记录等文本格式,以及视频、图片、音频和传感器数据等非文本格式。


邮件的正文部分实际属于非结构化数据,因为它由不含固定架构的自由格式文本组成。然而,发件人、收件人、时间戳和主题行等关联元数据则属于结构化数据。这种双重属性非常普遍,这也解释了为什么组织会使用 NLP 和 AI 从邮件内容中大规模提取数据洞察。



结构化数据依赖于固定的架构,并存储在使用 SQL 数据表的关系型数据库中。半结构化数据包含一定的结构化特征,但缺乏严格的架构约束,常见示例包括 JSON、XML 和 CSV 文件。非结构化数据不含任何预定义格式,包括视频和自由格式文本等文件,占据了企业级数据的绝大部分。

分析非结构化数据有哪些优势?

发掘隐藏在文本、图片和视频中的信息价值,能为您的企业带来巨大的竞争优势。以下是实现非结构化数据结构化所能带来的一些核心优势:

更深层次的客户洞察:

传统数据库会告诉您客户购买了哪些商品。而非结构化数据则能帮助解析其中的原因。通过分析社交媒体帖子、商品评价和客户支持来电记录,您可以评估用户的情感态度,并准确了解其需求。这有助于您开发出能够切实解决用户痛点的产品。

提升运营效率:

通过将手动任务自动化,您可以节省时间和资源。自然语言处理工具可以读取传入的支持邮件,并立即将其路由分发至相应的部门。这些工具还可以扫描复杂的法律合同,自动提取关键日期和条款。

主动式风险管理:

企业必须保护敏感数据,但要在庞大的数据湖中定位隐藏的个人信息可能会面临重重困难。机器学习模型可以快速扫描数百万份自由格式的文档和图片,从而定位并保护敏感数据。这能帮助您的企业确保符合严格的隐私权法。

预测性维护与监控:

通过分析非结构化事件日志和 IoT 传感器数据流,AI 模型可以发现人类可能遗漏的细微规律。例如,它们可以识别出表明设备即将发生故障的确切声波频率。由此,您可以在设备发生故障前进行维护,从而减少因停机带来的高昂成本。

更强大的 AI 与机器学习模型:

AI 模型需要海量信息来进行学习与持续改进。通过向模型输入丰富多样的非结构化数据(如图片、音频和自由格式文本),您可以让其对现实世界建立更广泛的认知。这样可以训练模型生成更准确、更可靠的预测。

AI 和机器学习如何释放非结构化数据的价值

若要从这些复杂文件中获取真正有价值的信息,您需要一个专用框架。人工智能与机器学习可作为该流程的核心引擎。例如,AI 辅助的自动化数据流水线可以帮助将视频文件或原始文本文档从庞大晦涩的二进制代码块转换为可读数据。

开发者可以运用特定的 AI 技术来处理各种不同类型的文件,包括:

  • 利用 NLP 读取文本密集型文档,例如邮件、支持工单和法律合同
  • 利用计算机视觉分析图片和视频,帮助完成审核监控录像、评估医学影像或处理卫星照片等任务
  • 利用 Speech-to-Text 模型转写音频文件,使文本可供检索和搜索

以下是现代 AI 数据流水线处理这些信息以推动实际解决方案的具体流程:

  1. 收集非结构化数据源:用户、设备和应用会不断生成原始数据。常见示例包括文本密集型邮件、视频文件、IoT 传感器流、PDF 以及社交媒体帖子。
  2. 通过数据接入层进行路由分发:系统会安全地收集传入数据,并将其路由分发至正确的存储目标。开发者通常使用高吞吐量数据流水线、API 网关或批量文件上传来迁移这些数据,从而避免减慢主应用的速度。
  3. 在存储层确保存储安全:系统会根据您对访问速度和频率的需求,为您稳妥地保存信息。您可以使用 Cloud Storage 构建原始数据湖,使用 Bigtable 存储高频 IoT 日志,或使用 Firestore 存储灵活的应用内容。
  4. 在处理层进行分析:AI 模型可在此环节提供有力支持。专用计算模型会读取、扫描和解读这些自由格式的文件,并利用上述 NLP、计算机视觉和语音转文字工具来提取深层含义。
  5. 提供数据洞见层:最后,系统会将处理后的数据转化为清晰、富有实用价值的商业智能 (BI)。最终,您将获得极具业务价值的输出结果,例如呼叫中心录音中的客户情感得分、用于合规的自动化文档分类,以及来自工厂传感器的预测性维护告警。
  6. 持续反馈与优化:低置信度的 AI 预测结果将被路由分发给人工审核员,以便进行验证和更正。这些新校正的数据会作为全新的训练数据反馈到第一步,用于重新训练和优化 AI 模型。此外,系统会不断追踪模型的准确率和延迟时间,以确保 AI 性能不会随着时间的推移而退化。

选择合适的非结构化数据管理解决方案

选择何种管理解决方案取决于您的具体工作负载和业务增长轨迹。您不妨先将本地文件存储与云对象存储区进行对比。而随着系统复杂性的提升,技术选型往往会转向云原生数据湖或全托管式 AI 集成平台。

在评估各种选项时,请参考以下技术核对清单:

  • 存储架构(文件存储、对象存储与数据湖对比)
  • 可扩缩至 PB 级,且经济高效
  • 原生 AI 与机器学习集成(NLP、计算机视觉、向量嵌入)
  • NoSQL 的灵活性(Bigtable 适用于高吞吐量工作负载,Firestore 适用于应用级内容)
  • 数据治理、访问权限控制及合规性功能
  • 支持多种格式(文本、图片、视频、音频及 IoT)
  • 与现有数据仓库、商业智能 (BI) 工具及分析平台无缝集成
  • 目标数据量下的总拥有成本

专为非结构化数据打造的存储功能

随着人工智能 (AI) 工作负载不断增长,存储不再仅仅是一个被动的数据存储库。而是已经成为 AI 性能链路中的一个关键活跃组件。为了消除影响开发者和数据库管理员的基础设施性能瓶颈,Google Cloud 推出了多项先进的非结构化存储功能。

如果您正在设计高性能的数据架构,可以利用以下特定工具来大规模地处理与管理非结构化格式:

  • 智能存储自动生成元数据:智能存储会在非结构化对象写入存储桶时,自动为其生成上下文(例如图片注释)。这彻底免去了开发人员手动构建自定义注释流水线的繁琐工作。它还支持 Model Context Protocol (MCP) 服务器集成,从而允许 AI 智能体以原生方式直接读取、写入和分析您的 Cloud Storage 数据。
  • 非结构化数据的数据洞见:此 Knowledge Catalog 功能利用 Gemini Enterprise Agent Platform 分析存储在数据湖中的 PDF 等原始非结构化文件的实际内容。它会自动推断架构并提取关系,将非结构化文件直接编入 BigQuery 对象表,以便您能立即对其进行查询。
  • Cloud Storage Rapid:该存储系列专为应对突发性 AI 处理高峰而设计,可提供极高的带宽和极低的延迟。Rapid Bucket 可提供超过 15 TB/s 的带宽,而 Rapid Cache 可将模型加载等密集型任务的读取吞吐量提高到 2.5 TB/s,且无需对现有存储桶进行任何代码更改。
  • Managed Lustre:如果您的基础设施团队正在构建大规模训练集群,Google Cloud Managed Lustre 现在可通过远程直接内存访问 (RDMA) 提供高达 10 TB/s 的吞吐量。这能确保您的高性能计算加速器能够持续、无延迟地获取所需数据。
  • Z4M 实例:对于正在构建自定义存储架构的企业,全新的 Z4M 实例支持可信的并行文件系统,且单实例最多可提供高达 168 TiB 的本地 SSD 容量。

通过利用这些专门构建的存储工具,您可以确保底层基础设施能够轻松支持现代智能体应用所需的极高吞吐量和高并发。



更进一步

获享 $300 赠金以及 20 多种提供“始终免费”用量的产品,开始在 Google Cloud 上构建项目。