干货推荐|数据可视化的五个步骤

数据被称作是最新的商业原材料「21世纪的石油」。商业领域、研究领域、技术发展领域使用的数据总量非常巨大,并持续增长。就Elsevier而言,每年从ScienceDirect下载的文章有7亿篇,Scopus上的机构档案有8万个、研究人员档案有 1 千 3 百万,Mendeley上的研究人员档案有 3 百万。对于用户来说,从这个数据海洋中抓到关键信息越来越难。

干货推荐|数据可视化的五个步骤

数据被称作是最新的商业原材料「21世纪的石油」。商业领域、研究领域、技术发展领域使用的数据总量非常巨大,并持续增长。就Elsevier而言,每年从ScienceDirect下载的文章有7亿篇,Scopus上的机构档案有8万个、研究人员档案有 1 千 3 百万,Mendeley上的研究人员档案有 3 百万。对于用户来说,从这个数据海洋中抓到关键信息越来越难。

许多先进的可视化方式(如:网络图、3D 建模、堆叠地图)被用于特定用途,例如 3D 医疗影像、模拟城市交通、救灾监督。但无论一个可视化项目有多复杂,可视化的目的是帮助读者识别所分析的数据中的一种模式或趋势,而不是仅仅给他们提供冗长的描述,诸如:“ 2000 年 A 的利润比 B 高出 2.9 % ,尽管 2001 年 A 的利润增长了 25 % ,但 2001 年利润比 B 低 3.5 % ”。出色的可视化项目应该总结信息,并把信息组织起来,让读者的注意力集中于关键点。

对于 Elsevier’s Analytical Services 的项目而言,我们一直在寻找提升数据分析和可视化的方式。例如,在我们对于研究表现的分析中有大量关于研究合作的数据;我们为 Science Europe 提供的报告(Comparative Benchmarking of European and US Research Collaboration and Researcher Mobility) 包含跨州合作以及国际合作的数据,这些数据不适合直接用二维表和X-Y图展示。

为了探索数据背后的故事,我们使用了网络关系图来识别国家间的合作,并了解每个合作关系的影响。

本文提供一份包含五个步骤的数据可视化指南,为想用表格、图形来传播观察结果、解读分析结果的人士提供帮助。要记住,建立好的可视化项目是一个反复迭代的过程。

第1步-明确问题

开始创建一个可视化项目时,第一步是明确要回答的问题,又或者试着回答下面的问题“这个可视化项目会怎样帮助读者?”

干货推荐|数据可视化的五个步骤

表 1–数据集中的三条记录

干货推荐|数据可视化的五个步骤

图1-槽糕的可视化项目并不澄清事实,而是引人困惑。此图中包含太多变量

清晰的问题可以有助于避免数据可视化的一个常见毛病:把不相干的事物放在一起比较。假设我们有这样一个数据集(见表 1 ),其中包含一个机构的作者总数、出版物总数、引用总数和它们特定一年的增长率。

图1是一个糟糕的可视化案例,所有的变量都被包含在一张表格中。在同一张图中绘制出不同类型的多个变量,通常不是个好主意。

注意力分散的读者会被诱导着去比较不相干的变量。

比如,观察出所有机构的作者总数都少于出版物总数,这没有任何意义,又或者发现 Athena University、Bravo University、Delta Institution 三个研究机构的出版物总数依次增长,也没有意义。拥挤的图表难以阅读、难以处理。在有多个 Y 轴时就是如此,哪个变量对应哪个轴通常不清晰。简而言之,槽糕的可视化项目并不澄清事实而是引人困惑。

第2步-从基本的可视化着手

确定可视化项目的目标后,下一步是建立一个基本的图形。它可能是饼图、线图、流程图、散点图、表面图、地图、网络图等等,取决于手头的数据是什么样子。在明确图表该传达的核心信息时,需要明确以下几件事:

  1. 我们试图绘制什么变量?
  2. X 轴和轴代表什么?
  3. 数据点的大小有什么含义吗?
  4. 颜色有什么含义吗?
  5. 我们试图确定与时间有关趋势,还是变量之间的关系?

有些人使用不同类型的图表实现相同目标,但并不推荐这样做。不同类型的数据各自有其最适合的图表类型。

比如,线形图最适合表现与时间有关的趋势,亦或是两个变量的潜在关系。当数据集中的数据点过多时,使用散点图进行可视化会比较容易。

此外,直方图展示数据的分布。直方图的形状可能会根据不同组距改变,见图 2 。(在绘制直方图时,本质是在绘制柱状图来展示特定范围内有多少数据点。这个范围叫做组距。)

干货推荐|数据可视化的五个步骤

图2-当组距变化,直方图的形状也发生变化。

组距太窄会导致起伏过多,让读者只盯着树木却看不到整个森林。此外,你会发现,在完成下一个步骤以后,你可能会想要修改或更换图表类型。

第3步-确定最能提供信息指标

假设我们有另一个关于某研究机构出版物数量的数据库(见表 2 )。可视化过程中最关键的步骤是充分了解数据库以及每个变量的含义。从表格中可以看出,在 A 领域(Subject A),此机构出版了 633 篇文章,占此机构全部文章的 39% ;相同时间内全球此领域共出版了 27738 篇文章,占全球总量的 44% 。 注意,B 列中的百分比累计超过 100% ,因为有些文章被标记为属于多个领域。

在这个例子中,我们想了解此机构在各个领域发表了多少文章。出版数量是一个有用的指标,不仅如此,与下面这些指标对照会呈现出更多信息:

  • 此领域的研究成果总量( B 列)
  • 此领域的全球活跃程度

由此,我们可以确定一个相对活跃指标,1.0 代表全球平均活跃程度。高于 1.0 代表高于全球水平,低于 1.0 代表低于全球水平。用 B 列的数据除以 D 列,得到这个新的指标,见表 2 。

干货推荐|数据可视化的五个步骤

表2-用B列的数据除以D列,得到新的指标:相对活跃程度(E栏)。

第4步-选择正确的图表类型

现在我们可以用雷达图来比较相对活跃指数,并着重观察指数最高/最低的研究领域。例如,此机构在 G 领域的相对活跃指数最高( 1.8 ),但是,此领域的全球总量远远小于其他领域(见图 3 )。雷达图的另一个局限是,它暗示各轴之间存在关系,而在本案例中这关系并不存在(各领域并不相互关联)。

干货推荐|数据可视化的五个步骤

图3-相对活跃指数雷达图

数据的规范化(如本例中的相对活跃指数)是一个很常见也很有效的数据转换方法,但需要基于帮助读者得出正确结论的目的使用。如在此例中,仅仅发现目标机构对某个小领域非常重视没太大意义。

我们可以把出版量和活跃程度在同一个图表中展示,以理解各领域的活跃程度。使用图 4 的玫瑰图,各块的面积表示文章数量,半径长短表示相对活跃指数。注意在此例中,半径轴是二次的(而图 3 中是典型线性的)。图中可以看出,B 领域十分突出,拥有最大的数量(由面积表示)和最高的相对活跃程度(由半径长度表示)。

干货推荐|数据可视化的五个步骤

图4-玫瑰图。此图中各块面积表示文章数量,半径长短表示相对活跃指数(E列)。

第5步-将注意力引向关键信息

用肉眼衡量半径长度可能并不容易。由于在本例中,相对活跃指数的 1.0 代表此领域的全球活跃程度,我们可以通过给出 1.0 的参照值来引导读者,见图 5 。这样很容易看出哪些领域的半径超出参考线。

干货推荐|数据可视化的五个步骤

图5-带有相对活跃指数参考线的玫瑰图

我们还可以使用颜色帮助读者识别出版物最多的领域。如图例所示,一块的颜色深浅由出版物数量决定。为了便于识别,我们还可以把各领域名称作为标签(见图 6 )。

干货推荐|数据可视化的五个步骤

图6-玫瑰图中的颜色深浅代表出版物数量(颜色越亮,出版物越多)

结论

数据可视化的方法有很多。新的工具和图表类型不断出现,每种都试图创造出比之前更有吸引力、更有利于传播信息的图表。我们的建议是记住以下原则:可视化项目应该去总结关键信息并使之更清晰直白,而不应该令人困惑,或用大量的信息让读者的大脑超载。

 

原作者:Georgin Lau and Lei Pan

翻译:王鹏宇

via:Datartisan数据工匠

原文地址:http://www.36dsj.com/archives/39986

原创文章,作者:Catherine,如若转载,请注明出处:https://www.iamue.com/30542/

(0)
CatherineCatherine
上一篇 2017-05-29 08:28
下一篇 2017-05-29 10:25

相关推荐

  • 这其实是一篇技术出身的产品经理所写的关于用户体验的深刻忏悔书

    十大交互原则实用总结 如果当初没有进入产品经理的队列,笔者说不定也是互联网程序猿中的一员。做技术出身的产品经理有好也有不好,好是因为一般有一个idea或者是新的需求,在没有用到特别尖端、特别前卫、特别超出…

    2015-11-30
  • 如何利用数据可视化改善移动端的交互体验?来自华尔街日报、Bloomberg 等顶级新闻工作室的新媒体从业者们是这样思考的:

    手机地图  移动交互 数据可视化 移动大潮席卷了你我。 如何利用数据可视化改善移动端的交互体验?来自华尔街日报、Bloomberg 等顶级新闻工作室的新媒体从业者们是这样思考的。 本文的原 po 给几乎每个案例、工具都…

    2016-04-08
  • 读书会第三期:《交互设计指南》

    《交互设计指南》的作者Dan Saffer是旧金山一家产品设计资讯公司Kicker Studio的负责人,也是交互设计领域的思想先行者,经常在国际进行各种演讲活动。这本书在国内最常见的是2010年发行的第2版中译本,其实它在2006年就有了第1版的英文版,它在10年前的目标读者群是设计行业的资深者,现在很适合交互设计师入门通读。交互设计的4种方法从2003年至2010年常见的交互设计方法论共有4种:以用户为中心的设计、以活动为中心的设计...

    2018-04-20
  • 用户体验地图(User Experience Map)制作过程中的一些误区

    作为一种新的产品设计以及用户体验设计工具,User Experience Map(用户体验地图)已经被越来越多的产品经理以及设计师们所接受;确实,在产品策略、功能设计、用户服务等一系列产品发展过程中,用户体验地图的建立可以直观的呈现用户在每一个目标任务下的行为、情感、思考过程,有效的为产品工作者提供各方面的信息。然而作为一种新的工具,铺天盖地的方法论将产品工作者淹没在前进的路上。大家都热衷于建立一个这样庞大而系统的“图片”,都不约而同的将注意力放在如何产出这个Map上,甚至是依葫芦画瓢根据国外的产出物反推这个东西是怎么制作出来的。基于这种现状大多产出的Map都会“徒劳无功”,着急产出的同时你已经忽略了很多原则性的东西。下面我们就从以下几个方面来聊一聊这个过程中容易进入的误区;

    2017-05-26
  • 用通俗的方式告诉你什么是「交互设计」

    通常来说,拥有成熟产品的大型互联网公司都会设有交互设计岗位,这个岗位在近几年的招聘市场上也越炒越火。不同于视觉设计师有可视化的作品展示,交互设计师的工作大多无法直观可视化或出于保密性难以对外展示,所以在大众心目中始终是神秘的存在。所以今天就来给大家分享一下我作为一个交互设计师眼中的交互是什么样的。文章的目的是帮助对交互设计不太了解,但工作相关或对此感兴趣的人对交互设计进行基础入门的了解,所以采用了尽量平实简单的描述方式,以帮助大家快速理...

    2018-04-11
  • 化繁为简——网易云音乐WP1.0设计思考

    项目背景 Windows Phone一直是各家公司缺少投入的平台,WP用户不得不经常面对一个成熟的APP到了WP上就变得各种功能缺失、体验支离破碎,他们渴望应用软件在体验 上能和其它平台一样受到同等重视,音乐APP也不例外。…

    2014-10-31
  • 如何系统地整理设计规范?

    整理规范对设计师的基本能力有很好的锻炼作用,所以各位设计师们整理规范时不要嫌琐碎麻烦,它可以让我们慢慢变强!

    2017-04-28
  • VR/AR开发程序中直接搜索Sketchfab的3D素材 / Vive Pro 如何买更省钱?/ Vulkan拥有直接内存分配器

    从今天起试试这个新形式,把重点的资讯提炼后合并成一条,欲知详情就摁紧二维码跳转阅读啦。我们依然尽量让这些从外媒翻译过来的信息以最合适的中文翻译方法论润饰和(或)修改后放在这里。有什么好想法新想法告诉我们!【Sketchfab推出新API,3D内容“搜索引擎”可植入VR/AR应用中】Sketchfab今天推出了最新的 Download API(下载API),允许应用开发者直接把Sketchfab内容导入他们的3D、VR和AR软件,这样就无...

    2018-03-21
  • 做你女朋友,用户体验太差了

    关注黑白每晚睡前一篇暖心好文等你文 / 李月亮来源 / 李月亮(bymooneye)●●●●●01见过一个不会谈恋爱的男生。是我前同事,颜值和收入都很高,当时坐在我隔壁桌。他跟女友打电话的画风通常是这样的:“破圣诞节有啥好过的,别整那洋事儿,老老实实在家待着吧。”“后天啥日子?你生日?你有啥要求?我这有张购物卡,你拿去自己买点东西吧。哎呀谁买不一样!”“你能不能别工作时间给我打电话啊,我忙得要死还得伺候你。”“有事说事儿!没正事儿是吧?...

    2018-04-30
  • APP小红点如何使用与实现逻辑

    作者:APP君   我们现在已经习惯小红点的不断的骚扰了,每天都不知道要点掉多少个手机APP上的小红点。有些童鞋点击 APP小红点 都已经成瘾。只要看到有小红点就会自然而然去触摸一下。 所以,APP的交互设计已经影响…

    交互专题 2017-08-07