什么是非结构化数据

非结构化数据是数据结构不规则或不完整,没有预定义的数据模型,不方便用数据库二维逻辑表来表现的数据。包括所有格式的办公文档、文本、图片、XML、HTML、各类报表、图像、音频和视频信息等等。

非结构化数据带来的挑战:

一、扩容难、成本高

随着数据的高速增长,传统存储 Scale-Up 的扩展方式,会造成“小马拉大车”的困境,性能与容量无法灵活扩展。同时,传统存储的扩容成本较高,随着大量的非结构化数据占用存储空间,扩容的需求将造成投资成本不断攀升。

二、数据体量大、获取和流转困难

对于已经保留下来的非结构化数据,真要去使用和处理它,依然是一项不讨好的“体力活儿”。由于体量、距离和网速的原因,非结构化数据并不容易获得,更不要说被灵活地放入业务分析和处理流程之中了。

三、缺乏处理分析的技术手段

非结构化数据的价值密度相对较低,缺乏有效的技术对非结构化数据进行处理和分析,面对海量文件数据束手无策。

     

类似文章

发表评论

您的电子邮箱地址不会被公开。