华体会备用网在线讯:在时下的流行语中,很难找出一个比“大数据”更吸引眼球的术语了。1980年,阿尔文•托夫勒在《第三次浪潮》中预言了信息时代的到来会带来数据爆发,约翰•梅西在1998年的美国高等计算机系统协会大会上首次提出“大数据(bigdata)”一词。什么是大数据?这一概念目前尚未形成统一的定义。几种代表性的观点如下:麦肯锡认为“大数据是指无法在一定时间内用传统数据库软件工具对其内容进行抓取、管理和处理的数据集合”;维基百科认为“大数据是指无法在一定时间内用常规软件工具对其内容进行抓取、管理和处理的数据集”;全球最具权威的IT研究与顾问咨询公司——高德纳公司认为“大数据是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产”。
大数据时代已经来临,它将在众多领域掀起变革的巨浪,这是勿庸置疑的事实,在以云计算为代表的技术创新大幕的衬托下,这些原本很难收集和使用的数据开始容易被利用起来了,通过各行各业的不断创新,大数据会逐步为人类创造更多的价值,而对于电网企业来说,大数据的应用同样会促进企业的跨越发展。
大数据的本质是事物的时域、空域记录,并非事物的描述数据
对于大数据的特点,IT界通常用Volume(大量)、Velocity(高速)、Variety(多样)、Value(价值)这4个V来概括。Volume,指数据体量巨大,从TB级别跃升到PB乃至EB级别;Variety,指数据类型繁多。除了传统的结构化数据,大量非结构化、半结构化数据如网络日志、音频、视频、图片等;Value,指价值密度低,但大数据分析的价值高。价值密度的高低与数据总量的大小成反比,以视频为例,一部一小时的视频,在连续不间断监控过程中,可能有用的数据仅仅只有一两秒;Velocity,指变化速度快。大数据不仅量大,而且变化快,大数据的应用依赖于对数据的快速处理。但在笔者看来,对大数据作4V特点的概括是现象而非本质总结。
其实人类文明就是大数据的记录与应用积累,当今社会进入了信息时代,信息化的本质是用IT技术和方法描述世界,描述事物的内在本质、过程规律和业务规则,信息化的应用过程就是在描述好事物的软件系统中实现人工和/或机器记录,大数据的本质是事物的时域、空域记录,并非事物的描述数据,大数据成为热门是因为信息化、互联网、终端的普及和应用让我们进入了一个机器自动记录的时代,爆炸性增长的记录数据使传统的人工、单机/单节点的机器处理能力无法完成记录的分析、挖掘,由此催生了云计算和大数据概念并推动人工智能的工程应用,机器学习等人工智能技术就是机器处理大数据及大数据应用高级模式。