认识和改造世界的第四范式?--大数据翟岩龙博士ylzhai@bit.edu.cn北京理工大学计算机学院Acknowledgement:Someofthematerialsarefrominternet,thankstotheauthors.ThankstoYabofromSYSU,GoogleandBaidu.目录一、大数据的来源二、什么是大数据三、大数据的应用四、成功案例电影《点球成金》数据本质是生产资料和资产仅供开采162年不可再生资源VS数据过去3年数据总量被以往4万年还多2013年,10分钟的信息总量将达1.8ZB2010年全球数据总量1.2ZB,年增长50%数据不再是社会生产的“副产物”,而是可被二次乃至多次加工的原料,从中可以探索更大价值,它变成了生产资料。数据爆炸式增长(每分钟……)分配丌透明,数据资产错配人力物力浪费数据丌开放,企业数据合作受限分布杂乱,处理缓慢,评估手段缺失,尽管“数据是资产”概念已经广为人知,但“如何管理数据资产”仍然缺少成熟理论以及工具手段需求发现数据资产管理是企业或组织采取的各种管理活劢,用以保证数据资产的安全完整,合理配置和有效利用,从而提高带来的经济效益,保障和促进各项事业发展。该领域是大数据时代企业布局竞争的核心,也是目前市场空白。什么是数据资产?存在什么问题?导致低效决策数据资产价值大定义丌统一错误判断加工流程混乱,数据源丌规范,导致无效数据加工数据资产闲置……打折扣治理无力应用低效运营缺失……数据资产是企业及组织拥有或控制,能带来未来经济利益的数据资源。数据资产管理的挑战元数据数据稽核管理制度为什么传统数据管理方式并不适合数据资产管理要求?传统数据管理方式外部性管理,依赖管理力度和执行自律,成难毁易。从范围来看,从形式来看,从内涵来看,非结构化数据、内外部数据混搭、云化处理等都会冲击传统管理模式挑战1数据加工的复杂度和速度要求越来越高,也对传统管理效率提出挑战挑战2数据的交换、转让、租赁、交易等各种创新模式,也要求新的管理手段挑战3资产验证数据整合交易保障数据资产管理的挑战需要不同“看”数据的方式8可视:结构化资料15%未视:半/非结构化数据85%DB/DW主管们看的战情数位仪表板,其实是残缺的…10万GB10万TB需要更高性价比的数据计算与储存方式9数据库数据仓库计算更快存储更省85%半/非结构化的Log/Webpage/Email/PDF/Image/Full-text/MS-Officefile需要不同的数据管理策略当我们想要扩充时,才发觉:•架构只能scale-up,scale-out不易•处理时间过长,time-to-value受限•成本过高,cost-efficiency受限15%结构化的DB/DW遗憾残缺每天几百GB、几TB的资料,且持续成长中储存Storing在收数据的同时做必要的前置处理(pre-processing),并区分数据处理的优先等级(prioritizing)计算Processing如何有效的避免因硬件毁坏所导致的资料损毁管理Managing如何从中挖掘出所关注事件的pattern或behavior分析Analyzing超越企业现有IT的数据解决能量11中央政府对大数据的重视程度习近平政府管理不仅要讲究策略,还要讲究手段,比如大数据技术的应用,2014年3月8日“大数据”首次写入政府工作报告奥巴马“将投入巨资拉动与大数据相关的产业”“数据为“未来的石油“,是美国综合国力的一部分,是与陆权、海权、空权同等重要的“国家核心资产”。李克强:加快推进全国中小企业征信系统建设,通过大数据等技术优化中小企业征信资质。李克强经济数据和目标的进一步调整,中小企业将面临更大的压力,互联网金融除了解决便利性问题外,更重要的是如何围绕特有的大数据资源展开对实体经济的服务汪洋数据为王,财政工作离不开大数据目录二、什么是大数据三、大数据的应用四、成功案例一、大数据的来源14SocialMediaMachine/SensorDOC/MediaWebClickstreamAppsCallLogLog什么是数据?半结构化/非结构化数据3/13/20124什么是大数据?何为大?—数据度量1Byte=8Bit1KB=1,024Bytes1MB=1,024KB=1,048,576Bytes1GB=1,024MB=1,048,576KB=1,073,741,824Bytes1TB=1,024GB=1,048,576MB=1,099,511,627,776Bytes1PB=1,024TB=1,048,576GB=1,125,899,906,842,624Bytes1EB=1,024PB=1,048,576TB=1,152,921,504,606,846,976Bytes1ZB=1,024EB=1,180,591,620,717,411,303,424Bytes1YB=1,024ZB=1,208,925,819,614,629,174,706,176Bytes什么是大数据?《红楼梦》含标点87万字(不含标点853509字)每个汉字占两个字节:1汉字=16bit=2*8位=2bytes1GB约等于671部红楼梦1TB约等于631,903部1PB约等于647,068,911部美国国会图书馆藏书(151,785,778册)(2011年4月:收录数据235TB)中国国家图书馆:2631万册1EB=4000倍美国国会图书馆存储的信息量600美元的硬盘就可以存储全世界所有的歌曲MGI估计,全球企业2010年在硬盘上存储了超过7EB(1EB等于10亿GB)的新数据,同时,消费者在PC和笔记本等设备上存储了超过6EB新数据7数据没有办法在可容忍的时间下使用常规软件方法完成存储、管理和处理任务什么是大数据?大数据的解释大数据是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。大数据就是“未来的新石油”。大数据带来的思维变革更好不是因果关系而是相关关系更多不是随机样本而是全部数据大数据带来的思维变革(更多)大数据时代大数据带来的思维变革(更多)大数据时代大数据带来的思维变革(更多)大数据时代大数据带来的思维变革(更多)大数据带来的思维变革(更杂)从皮尺到哈勃望远镜,人类一直在追求测量的精确性,一方面源于对未知世界的认知;一方面也源于收集信息的有限性;−IBM的机器翻译VSGoogle的机器翻译;−大数据时代要求我们重新审视数据精确性的优略;−大数据不仅让我们不再期待精确性,也让我们无法实现精确性;−错误不是大数据固有的问题,而是一个需要我们去解决的问题,而且会将长期存在;大数据带来的思维变革(更好)佛教《三世因果经》主要讲:一是人的命是自己造就的;二是怎样为自己造一个好命;三是行善积德与行凶作恶干坏事的因果循环报应规律。原因和结果是揭示客观世界中普遍联系着的事物具有先后相继、彼此制约的一对范畴。原因是指引起一定现象的现象,结果是指由于原因的作用而引起的现象。大数据的相关关系,而不强调因果关系;(舍恩伯格),其实这个只是一种对无法探究因果的妥协,人类应该去探寻因果,因为世界存在客观的运转规律;大数据的4V特征Volume•非结构化数据的超大规模和增长•总数据量的80~90%•比结构化数据增长快10倍到50倍•是传统数据仓库的10倍到50倍Value•大量的不相关信息•对未来趋势与模式的可预测分析•深度复杂分析(机器学习、人工智能Vs传统商务智能)Velocity•实时分析而非批量式分析•数据输入、处理与丢弃•立竿见影而非事后见效Variety•大数据的异构和多样性•很多不同形式(文本、图像、视频、机器数据)•无模式或者模式不明显•不连贯的语法或句义BigData大数据TBPBEBStreamsRealtimeNeartimeBatchStructuredUnstructuredSemi-structuredAlltheabove大数据的4V特征(Volume)1Byte1KB1MB1GB1TB1PB1EB1ZB1YB1PB相当于50%的全美学术研究图书馆藏书信息内容5EB相当于至今全世界人类所讲过的话语1ZB如同全世界海滩上的沙子数量总和1YB相当于7000位人类体内的微细胞总和大数据的4V特征(Velocity)•实时数据流处理的要求,是区别大数据引用和传统数据仓库技术,BI技术的关键差别之一;•1s是临界点,对于大数据应用而言,必须要在1秒钟内形成答案,否则处理结果就是过时和无效的;大数据的4V特征(Variety)大数据的4V特征(Value)•挖掘大数据的价值类似沙里淘金,从海量数据中挖掘稀疏但珍贵的信息;•价值密度低,是大数据的一个典型特征;大数据不仅仅是技术,关键是产生价值可以从各个层面进行优化,更要考虑整体行业数据处理方式价值银行/金融•贷款、保险、发卡等多业务线数据集成分析、市场评估•新产品风险评估•股票等投资组合趋势分析•增加市场份额•提升客户忠诚度•提高整体收入•降低金融风险医疗•共享电子病历及医疗记录,帮助快速诊断•穿戴式设备远程医疗•改善诊疗质量•加快诊疗速度制造/高科技•产品故障、失效综合分析•专利记录检索•智能设备全球定位,位置服务•优化产品设计、制造•降低保修成本•加快问题解决能源•勘探、钻井等传感器阵列数据集中分析•降低工程事故风险•优化勘探过程互联网/Web2.0•在线广告投放•商品评分、排名•社交网络自动匹配•搜索结果优化•提升网络用户忠诚度•改善社交网络体验•向目标用户提供有针对性的商品与服务政府/公用事业•智能城市信息网络集成•天气、地理、水电煤等公共数据收集、研究•公共安全信息集中处理、智能分析•更好地对外提供公共服务•舆情分析•准确预判安全威胁媒体/娱乐•收视率统计、热点信息统计、分析•创造更多联合、交叉销售商机•准确评估广告效用零售•基于用户位置信息的精确促销•社交网络购买行为分析•促进客户购买热情•顺应客户购买行为习惯13大数据商业价值大数据商业价值---大数据为“未来的新石油”322013年,世界上存储的数据预计能达到约1.2泽(约12亿TB)字节,如果把这些数据全部印刷成书,这些书可以覆盖整个美国52次,如果将之存储于标准的光盘,这些光盘可以堆成五堆,每一堆都可以伸到月球。2012年3月22日,奥巴马政府宣布投资2亿美元拉动大数据相关产业发展,将“大数据战略”上升为国家战略。奥巴马政府甚至将大数据定义为“未来的新石油”。大数据商业价值---企业经营决策33某商店卖牛奶,通过数据分析,知道在本店买了牛奶的顾客以后常常会再去另一店买包子,人数还不少,那么这家店就可以考虑与包子店合作,或直接在店里出售包子。大数据商业价值---个性化营销34银行与客户的交流渠道进行了整合,只要某个客户在网上点击查询了有关房贷利率的信息,系统就会提示呼叫中心在电话交流时推荐房贷产品,如果发现顾客确实对此感兴趣,销售部门就会发送推介信息给客户,如果这位顾客到银行网点办事,业务人员就会详细介绍房贷产品,开始只有少量的线索,但通过多渠道的与顾客交互接触,在这个过程中,令顾客体验了银行精准、体贴的服务,其结果是营业收入大为增加,成本大幅降低,大数据商业价值---互联网金融的核心是大数据35互联网金融并非简单的把传统金融业务搬到网上去,而是充分利用大数据来颠覆银企之间信息不对称的问题。数据是一个平台,因为数据是新产品和新商业模式的基石。推动互联网金融发展的核心正是大数据的价值。大数据商业价值---所有互联网公司都将是大数据公司36大数据商业价值---数据列入企业资产负债表只是时间问题37用资产的要素来盘点一下什么样的数据符合资产的要求:1,从拥有和控制的角度来看,数据可以分为第一方数据、第二方数据和第三方数据。2,对于数据资产的货币计量,可以参照无形资产的计量规则。3,目前直接利用数据为企业带来经济利益的方法主要有数据租售、信息租售、数据使能三种模式。4,要实现数据的保值增值,就要从扩大数据规模,提高数据活性,提升收集运用数据的能力大