-
万字详解大数据平台异地多机房架构实践
所属栏目:[大数据] 日期:2022-08-25 热度:103
01 背景 随着B站业务的高速发展,业务数据的生产速度变得越来越快,离线集群规模快速膨胀,既有机房内的机位急剧消耗,在可预见的不久的将来会达到机房容量上限,阻塞业务的发展。因此,如何解决单机房容量瓶颈成为了我们亟待解决的问题。 目前,针对机房容[详细]
-
抽丝剥茧,深入的数据分析这么做!
所属栏目:[大数据] 日期:2022-08-25 热度:192
很多同学总觉数据分析做得不深入,到底该怎么做?今天结合一个具体的例子,分享下如何做一个深入的数据分析项目。 深入级别:0级 某天,你收到一个需求:看下我司APP新增的A功能,过去5天内累计使用1+次的人有多少(去重)。这问题太简单了,直接跑个数丢过[详细]
-
如何利用大数据驱动业务增长?
所属栏目:[大数据] 日期:2022-08-25 热度:73
大数据在商业中的作用日趋凸显,数据驱动已经成为企业发展的核心竞争力。 然而,在日常工作中,数据团队常常是业务部门的工具人,需要数据的时候向数据团队提个需求,但业务究竟是如何运转的,对数据团队来说,是接触不到的,更别提驱动业务增长了。 说到底[详细]
-
从0到1构建大数据平台,如何规划集群硬件与软件
所属栏目:[大数据] 日期:2022-08-25 热度:168
01大数据集群节点规划 1.HDFS集群节点规划 假如业务系统数据量每天增量 50T,保留周期为 30 天,那么 HDFS 存储 容量为 50T * 30 天 * 3 副本 * 2 倍(数据源+清晰加工) = 9000T = 8.79P 。假如每个机器的磁盘是 4T * 10 = 40T, 每台机器的可用存储容量为 4[详细]
-
大厂大数据平台核心架构满级图鉴
所属栏目:[大数据] 日期:2022-08-25 热度:150
我们先来看看这张图,这是某公司使用的大数据平台架构图,大部分公司应该都差不多: 图片 从这张大数据的整体架构图上看来,大数据的核心层应该是:数据采集层、数据存储与分析层、数据共享层、数据应用层,可能叫法有所不同,本质上的角色都大同小异。 所以[详细]
-
为什么可变性对实时数据分析至关重要
所属栏目:[大数据] 日期:2022-08-25 热度:83
像Uber、Facebook和Amazon这样成功的数据驱动型公司依靠的是实时数据分析,为电子商务提供个性化的客户体验,管理车队和供应链,以及实现内部运营的自动化,都需要对最新鲜的数据进行即时洞察。 为了提供实时分析,公司需要一个现代技术基础设施,包括这三点[详细]
-
关于认知分析,你需要知道的一切
所属栏目:[大数据] 日期:2022-08-25 热度:64
为了提供场景并发现隐藏在大量信息中的答案,认知计算结合了各种应用程序。认知分析和智能技术的使用使大多数数据源可用于决策和商业智能分析程序。 什么是认知分析? 每个人都试图找到认知分析是什么以及智能技术是什么问题的答案。在IT行业工作的每个人都[详细]
-
2022年制造业九大趋势
所属栏目:[大数据] 日期:2022-08-25 热度:50
我们在去年制造业趋势中预测的重要主题,今年仍然在列,并且排在前列,例如安全和预测性维护。工业发展的核心要素也将继续发挥重要作用,包括3D打[详细]
-
终于有人把Hadoop大数据系统架构讲清楚了
所属栏目:[大数据] 日期:2022-08-25 热度:64
传统的系统已无法处理结构多变的大数据,而高性能硬件和专用服务器价格昂贵且不灵活,Hadoop因此应运而生。Hadoop使用互连的廉价商业硬件,通过数百甚至数千个低成本服务器协同工作,可有效存储和处理大量数据。 1.Hadoop生态体系 Google通过三篇重量级论文[详细]
-
交通领域的物联网如何使大数据之于企业产生价值
所属栏目:[大数据] 日期:2022-08-25 热度:78
全球物流市场不断增长,科技正成为发展的主要触发器。 企业正在寻找用于运输的物联网解决方案,以帮助他们提高供应链的可见性、改善物流各个阶段的运营并节省资源。 这可以通过使用物联网设备收集有关物流过程的数据并将其转换为有价值的业务信息来实现。 让[详细]
-
怎样用好数据科学
所属栏目:[大数据] 日期:2022-08-25 热度:124
很长一段时间以来,数据科学一直被视为科技和商业领域的下一次重大革命。最近几年增加了不少使用数据科学应用的企业。根据Statista的数据,截至2021年,近60%的公司在其团队中拥有至少50名数据科学家。 然而,如果客观地看待,数据科学提供的结果与它的期望[详细]
-
浅析大数据的数据灾备建设
所属栏目:[大数据] 日期:2022-08-25 热度:162
大数据时代,数据呈爆炸趋势增长,很多企业都从大数据中获得了利益,推动各自的业务上升了一个台阶。通过大数据技术的完善尤其是大数据和云容器技术相结合,各个企业已经把自己的重要业务迁移到了大数据平台。与此同时企业对数据可靠性和业务连续性保证的诉[详细]
-
未来已来 Cloudera拥抱混合数据年代
所属栏目:[大数据] 日期:2022-08-25 热度:121
我们生活在一个混合数据的世界中。在过去十年间,世界创建、捕获、复制和使用的结构化数据量已从2011年的不到 1ZB 增长到 2020 年的近 14ZB,这已经很惊人了,但还有另外更巨大的 50ZB数据非结构化数据、云数据和机器数据。 对于Cloudera来说,这是一个回到[详细]
-
如何策划数据可视化平台
所属栏目:[大数据] 日期:2022-08-25 热度:74
最近在项目上常常听到这样的话:我想要一个酷炫的数据大屏,设计一定要有科技感,这个可视化设计没有重点每当听到这些需求,作为设计师一般都是欲哭无泪的。到底什么叫酷炫有科技感?客户理解的数据大屏什么样?是数据还是可视化出了问题?? 这篇文章将会结[详细]
-
Python实行数据可视化 你会用什么库来做呢
所属栏目:[大数据] 日期:2022-08-25 热度:58
用Python进行数据可视化你会用什么库来做呢? 今天就来和大家分享Python数据可视化库中的一员猛将Altair! 借助Altair,我们可以将更多的精力和时间放在理解数据本身及数据意义上,从复杂的数据可视化过程中解脱出来。 简单来说,Altair是一种可视化语法,也[详细]
-
一文看清楚 数据指标体系的几大类别
所属栏目:[大数据] 日期:2022-08-25 热度:101
很多同学问:有没有普遍的、一般的指标体系梳理方法?网上常见的指标体系分享,大多是互联网的AARRR一类,现实中情况却很复杂。普遍的方法当然有,就是基于业务逻辑,梳理指标体系。从本质上看,数据指标体系有4大类型,针对四个不同的业务逻辑。今天来系统[详细]
-
两种主流大数据系统架构的差异 终于有人讲明白了
所属栏目:[大数据] 日期:2022-08-24 热度:190
同样都可以处理大规模数据的MPP数据库架构与Hadoop体系架构属于不同的技术体系,二者没有直接的相关性,却常常被放在一起进行比较。特别是在企业数据仓库建设中,MPP架构与Hadoop架构代表两类典型的技术路线选型,事实上,在2015年左右甚至有人认为基于Hadoo[详细]
-
从0到1创建智能灰度数据体系 以vivo游戏中心为例
所属栏目:[大数据] 日期:2022-08-24 热度:177
本文介绍了vivo游戏中心在灰度数据分析体系上的实践经验,从实验思想-数学方法-数据模型-产品方案四个层面提供了一套较为完整的智能灰度数据解决方案,以保障版本评估的科学性、项目进度以及灰度验证环节的快速闭环。该方案的亮点在于,指标异动根因分析方法[详细]
-
几个好使常见的大数据分析模型
所属栏目:[大数据] 日期:2022-08-24 热度:135
互联网打工人来说,数据分析是一项必备技能!花了这么多钱,营销效果到底达到没有?什么样的功能才能真正戳中用户的痛点? 1. 事件分析 干啥的:研究某行为事件的发生对企业组织价值的影响以及影响程度。 怎么用:追踪或记录的用户行为或业务过程,如用户注[详细]
-
大数据项目可能出错的几种方案
所属栏目:[大数据] 日期:2022-08-24 热度:66
大数据项目的低成功率是过去10年中一个持续存在的问题,与之类似的是:人工智能项目中也出现了相同类型的问题。虽然100%的成功率不是一个可以实现的目标,但用户可以进行一些调整以从数据投资中获得更多收益。 一个重要原因是缺乏数据集中化,这抑制了公司从[详细]
-
MPP与Hadoop 两种主流大数据系统架构有什么差别
所属栏目:[大数据] 日期:2022-08-24 热度:170
同样都可以处理大规模数据的MPP数据库架构与Hadoop体系架构属于不同的技术体系,二者没有直接的相关性,却常常被放在一起进行比较。 1. 设计思路对比 两类系统运行的硬件架构是相同的,都是普通服务器组成的集群,但从资源管理角度来说,它们并行化软件实现[详细]
-
为什么大热的数据可视化行业 我不提议轻易入行
所属栏目:[大数据] 日期:2022-08-24 热度:92
这两年互联网行业在 C 端市场上的增长已经不足以吸引大众和投资者的视线,B 端作为一个新的热点开始被追捧。 各种让人眼花缭乱的图例和技术应用解说,很容易让我们产生未来已经加速向我们走来的 幻觉,此时不抓紧时代的机遇投身数字化界面的设计,更待何时?[详细]
-
数据指标 VS 标签体系 到底有啥区别 总算讲清楚了
所属栏目:[大数据] 日期:2022-08-24 热度:88
实际上,标签和指标一样,是数据分析的左膀右臂,两者同样重要。实际上,很多人分析不深入,就是因为缺少对标签的应用。今天系统的讲解下。 那如果做得好的话,标签能发挥啥作用呢? 一:查询信息。这是最普遍的场景了。大量的一线工作人员会有需求,比如客[详细]
-
为什么完善数据供应链是一种责任
所属栏目:[大数据] 日期:2022-08-24 热度:90
如今,企业拥有比以往任何时候都要多的数据,数据架构师、分析师和数据科学家在所有业务职能部门中变得越来越普遍。然而,随着企业招募经验丰富的分析师以利用数据做出更好的决策,他们往往无法改善数据供应链和由此产生的数据质量。如果没有可靠的数据供应[详细]
-
2022大数据十大关键词 重磅公布
所属栏目:[大数据] 日期:2022-08-24 热度:173
大数据几大关键词是基于我们长期对于产业的研究观察,以及与一线专家的研讨交流完成。如图所示,本年度十大关键词涉及数据从计算机语言到成为生产要素的全生命周期,包括 【数据资源化】,即数据从计算机语言到成为可被人类识别的信息 【数据治理】,即将散[详细]