所谓非结构化数据,是指那些不拘泥于预定义格式、模型或结构的信息。它无法整齐地存入行和列之中。因此,传统的关系型数据库管理系统 (RDBMS) 往往难以对其进行存储、处理和分析。它是每天源源不断涌入您业务系统的自由格式信息。以下是它对企业架构的影响:
在多个行业中,非结构化数据源都在迅猛增长,这给系统架构设计带来了一些独特的挑战:
如何捕获、存储和理解这些非结构化信息,是现代数据架构需要解决的核心问题。
非结构化数据的核心特征在于其缺乏预定义的数据模型。这类数据以多种多样的格式呈现,例如文本、图片、视频、音频和物联网 (IoT) 遥测数据。与规整的电子表格数据不同,这类信息通常会以 PB 级的海量规模不断累积。它结构复杂、高度可变,并且处于不断的动态变化中。
处理这些自由格式的文件需要采用截然不同的技术方案,这主要源于以下几个核心原因:
通过对比这几种格式,您可以更清晰地了解它们之间的区别与联系。结构化数据依赖 SQL,强制执行严格的数据架构,并且非常便于检索和查询。非结构化数据没有固定的架构,很难以原生方式进行检索,因而需要数据湖或 NoSQL 数据库解决方案。介于两者之间的则是半结构化数据(例如 JSON 或 XML),这类数据包含一定的组织性标记,但缺乏严格的关系型架构。
数据类型 | 数据模型 | 存储 | 查询方法 | 示例 | 数据量分布 |
结构化数据 | 严格的预定义架构 | 关系型数据库 | SQL | 财务记录、库存 | 中 |
半结构化数据 | 灵活、自描述 | NoSQL(文档存储区) | NoSQL API、SQL 扩展 | JSON、XML、CSV | 持续增长 |
非结构化数据 | 无预定义模型 | 数据湖、对象存储区、NoSQL | AI、机器学习、NLP、搜索索引 | 文本、视频、图片、音频 | 占据 85% 至 90% 的主导地位 |
数据类型
数据模型
存储
查询方法
示例
数据量分布
结构化数据
严格的预定义架构
关系型数据库
SQL
财务记录、库存
中
半结构化数据
灵活、自描述
NoSQL(文档存储区)
NoSQL API、SQL 扩展
JSON、XML、CSV
持续增长
非结构化数据
无预定义模型
数据湖、对象存储区、NoSQL
AI、机器学习、NLP、搜索索引
文本、视频、图片、音频
占据 85% 至 90% 的主导地位
若要构建契合业务需求的数据流水线,您应当准确了解所处理的信息类型,以及企业团队实际如何利用 Google Cloud 数据库进行高效管理。您可以将非结构化数据划分为两大核心类别:人类生成的数据和机器生成的数据。
这些是您的用户和员工每天手动创建的内容示例。
电脑、传感器和服务器会在后台自动生成海量数据,无需任何人工干预。
为了构建高可伸缩性的应用,开发者应根据其数据类型选择最匹配的存储环境。结构化数据与非结构化数据需要采用完全不同的底层架构,从而在保障卓越性能的同时将基础设施成本控制在合理范围内。
对于结构化数据,组织通常依赖于企业级数据仓库 (EDW)。该环境专为处理遵循严格规则和可预测格式的数据而设计。
非结构化数据则需要采用更为灵活的处理方式。由于视频、录音和原始文本日志等大型文件无法放入整齐的表格中,开发者会使用数据湖和云存储桶来存储这些文件。
以下是开发者和架构师针对非结构化数据经常提出的常见问题解答。
常见示例包括邮件、社交媒体帖子、PDF 以及音频或视频文件等由人类创建的内容。此外,还包括机器生成的数据格式,例如卫星图像和 IoT 传感器遥测数据。这些复杂多样、自由格式的数据构成了日常企业数据的绝大部分,无法整齐地组织到标准数据库的行和列中。
CSV 文件通常被视为结构化或半结构化数据,因为它由行、列和一致的分隔符组织而成。尽管它缺乏严格的关系型架构强校验,但其表格格式使其高度有序。这使得 CSV 文件的结构化程度远高于视频、图片或自由格式文本等真正的非结构化数据。
SQL 是一种用于结构化关系型数据的标准查询语言,而非数据类型本身。它依赖严格的架构和表来检索信息。因此,如果不进行额外处理或使用扩展,它便无法原生查询图片、音频或自由格式文本等非结构化数据。
您可以通过非结构化数据缺少预定义数据模型的特征来识别此类数据。如果信息无法整齐地组织在行和列中,且您无法使用 SQL 直接进行查询,则其很可能属于非结构化数据。实际表现形式包括邮件和聊天记录等文本格式,以及视频、图片、音频和传感器数据等非文本格式。
邮件的正文部分实际属于非结构化数据,因为它由不含固定架构的自由格式文本组成。然而,发件人、收件人、时间戳和主题行等关联元数据则属于结构化数据。这种双重属性非常普遍,这也解释了为什么组织会使用 NLP 和 AI 从邮件内容中大规模提取数据洞察。
结构化数据依赖于固定的架构,并存储在使用 SQL 数据表的关系型数据库中。半结构化数据包含一定的结构化特征,但缺乏严格的架构约束,常见示例包括 JSON、XML 和 CSV 文件。非结构化数据不含任何预定义格式,包括视频和自由格式文本等文件,占据了企业级数据的绝大部分。
大多数企业架构的发展最终都会超出单一存储平台的承载上限。随着系统规模的扩大,数据湖和存储桶自然会分散在不同的区域和云服务商中。当您尝试构建需要同时访问所有非结构化文件的机器学习流水线时,这种数据碎片化会形成瓶颈。
Google Cloud 通过 Agentic Data Cloud 攻克了这一特定的架构挑战。它采用 AI 原生跨云湖仓一体架构,将您的分布式存储环境连接至统一的访问入口。
发掘隐藏在文本、图片和视频中的信息价值,能为您的企业带来巨大的竞争优势。以下是实现非结构化数据结构化所能带来的一些核心优势:
更深层次的客户洞察:
传统数据库会告诉您客户购买了哪些商品。而非结构化数据则能帮助解析其中的原因。通过分析社交媒体帖子、商品评价和客户支持来电记录,您可以评估用户的情感态度,并准确了解其需求。这有助于您开发出能够切实解决用户痛点的产品。
提升运营效率:
通过将手动任务自动化,您可以节省时间和资源。自然语言处理工具可以读取传入的支持邮件,并立即将其路由分发至相应的部门。这些工具还可以扫描复杂的法律合同,自动提取关键日期和条款。
主动式风险管理:
企业必须保护敏感数据,但要在庞大的数据湖中定位隐藏的个人信息可能会面临重重困难。机器学习模型可以快速扫描数百万份自由格式的文档和图片,从而定位并保护敏感数据。这能帮助您的企业确保符合严格的隐私权法。
预测性维护与监控:
通过分析非结构化事件日志和 IoT 传感器数据流,AI 模型可以发现人类可能遗漏的细微规律。例如,它们可以识别出表明设备即将发生故障的确切声波频率。由此,您可以在设备发生故障前进行维护,从而减少因停机带来的高昂成本。
更强大的 AI 与机器学习模型:
AI 模型需要海量信息来进行学习与持续改进。通过向模型输入丰富多样的非结构化数据(如图片、音频和自由格式文本),您可以让其对现实世界建立更广泛的认知。这样可以训练模型生成更准确、更可靠的预测。
若要从这些复杂文件中获取真正有价值的信息,您需要一个专用框架。人工智能与机器学习可作为该流程的核心引擎。例如,AI 辅助的自动化数据流水线可以帮助将视频文件或原始文本文档从庞大晦涩的二进制代码块转换为可读数据。
开发者可以运用特定的 AI 技术来处理各种不同类型的文件,包括:
以下是现代 AI 数据流水线处理这些信息以推动实际解决方案的具体流程:
选择何种管理解决方案取决于您的具体工作负载和业务增长轨迹。您不妨先将本地文件存储与云对象存储区进行对比。而随着系统复杂性的提升,技术选型往往会转向云原生数据湖或全托管式 AI 集成平台。
在评估各种选项时,请参考以下技术核对清单:
随着人工智能 (AI) 工作负载不断增长,存储不再仅仅是一个被动的数据存储库。而是已经成为 AI 性能链路中的一个关键活跃组件。为了消除影响开发者和数据库管理员的基础设施性能瓶颈,Google Cloud 推出了多项先进的非结构化存储功能。
如果您正在设计高性能的数据架构,可以利用以下特定工具来大规模地处理与管理非结构化格式:
通过利用这些专门构建的存储工具,您可以确保底层基础设施能够轻松支持现代智能体应用所需的极高吞吐量和高并发。