大数据的分析价值和人才培养原则

胡悦

清华大学社会科学学院政治学系
清华大学计算社会科学平台
清华大学数据与治理研究中心

2024-05-21

个人简介

个人经历

  • 政治科学博士(University of Iowa)
    • 信息学(Graduated Certificate in Informatics)
  • 清华大学计算社会科学平台(副主任)
    • 清华数据与治理中心(副主任)
    • 计算社会科学编程语言证书项目(负责人)

研究兴趣认知、行为与现代性

  • W. 数据科学
    • 实验室和调查实验
    • 潜变量分析、网络分析、空间分析
    • 文本大数据分析、数据可视化

研究领域

  • W. 心理学
    • 政治认知与行为
    • 政治传播
    • 身份政治(城乡、司法)
  • W. 经济学
    • 社会经济不平等感知
  • W. 语言学
    • 语言能力的政治影响
    • 语言政策的治理功能

概要

  • 数据性质与价值
  • 数据分析的计算社会科学视野
  • 政务(大)数据分析方法与应用
  • 政务(大)数据分析迷思与原则

数据性质与价值

大数据 → 社会科研

什么是大数据

Goldston (2008)

Goldston (2008)

人类社会的“快速、大尺度、深层次”数字化转型

  • 社会数字化—海量资源待处理
  • 数据科学—计算机辅助方法
  • 新生现象—理论、新范式

Science Staff (2011)

Science Staff (2011)

政务数据的来源

(政务)数据来源

  1. 电子政务、公务电话热线、政民互动数据
  2. 各机构和部门的官方数据
  3. 演讲、声明
  4. 传统和新媒体
  5. 官方文件档案
  6. 司法文件 ……

目标

  1. 议程的启动
  2. 政策制定者的概况
  3. 政策制定过程
  4. 政策决策和执行的逻辑
  5. 政策评估
  6. 政策结果的预测 ……

大数据特点

大数据是指需要新处理模式才能确保更强的决策力、洞察力和流程优化力的海量、高速增长和多样化的信息财富 (Gärtner and Hiebl 2017)

战略视野下的数据价值

  • 大数据是以容量大、类型多、存取速度快、应用价值高为主要特征的数据集合,正快速发展为对数量巨大、来源分散、格式多样的数据进行采集、存储和关联分析,从中发现新知识、创造新价值、提升新能力的新一代信息技术和服务业态。(国务院 2015)
  • 数据已成为国家基础性战略资源(十三五)
  • 数据是重要生产要素(十九届四中全会)
  • 加快构建数字技术辅助政府决策机制,提高基于高频大数据精准动态监测预测预警水平。强化数字技术在公共卫生、自然灾害、事故灾难、社会安全等突发公共事件应对中的运用,全面提升预警和应急处置能力。(十四五)

认知视野下的数据价值

数据是新的石油 —克莱夫·亨比 (2006)
世界上最宝贵的资源不再是石油而是数据 — 经济学人(2017)

价值是指人们对于某种事物或概念认为重要、有意义、有用或有吸引力的程度。价值在经济学中通常与稀缺性相关

排他 非排他
竞争 私有产品
食物、石油、普通制成品、私人池塘里的鱼等。
公共资源
森林、矿山、海洋中的鱼等。
非竞争 俱乐部产品
卫星电视、私人公园等。
公共产品
国防、航空、阳光、新闻等。

数据价值独特性 (Liu 2021)

  • 估值困境:数据意识
  • 管理困境:数据政策
  • 使用困境:数据方法
    • 数据价值是分析出来的
    • E.g., 计算社会科学

信息具有价值,但不经提纯则无法使用
—迈克尔·庞莫(2006)
信息是21世纪的石油,分析是内燃机
—彼得·桑德加德(2011)

小结

  • 大数据定义
    • 体量大、消极数据
  • 大数据特点
    • Volume, velocity, variety, variability, veracity, value
  • 数据价值
    • 战略视野下价值
    • 认知视野下价值
      • 估值困境
      • 管理困境
      • 使用困境

数据分析的计算社会科学视野

数据科学

数据科学发展沿革

什么是社会科学

社会科学是用科学的方法,研究人类社会的种种现象。

  • 政治学
  • 经济学
  • 社会学
  • 国际关系
  • 心理学
  • 行政学
  • 军事学
  • 统计学
  • 人类学
  • 民俗学
  • 公共关系学
  • 公共行政学
  • 犯罪学
  • 考古学
  • 教育学
  • 语言学
  • 社会工作
  • 新闻学
  • 传播学
  • 宗教学
  • 图书馆学
  • 区域研究
  • 发展研究
  • 环境研究
  • 性别研究
  • 媒体研究 ……

  • 马克思主义理论
  • 法学
  • 历史

计算社会科学

“计算社会科学”这一研究领域正在兴起,人们将在前所未有的深度和广度上自动地收集和利用数据,为社会科学的研究服务。社会计算是指社会行为和计算系统交叉融合而成的一个研究领域,研究的是如何利用计算技术帮助人们进行沟通与协作,如何利用计算技术研究社会运行的规律与发展趋势

学科交叉

  • Lazer et al. (2009): 15位美国学者在Science上联合发表里程碑意义文章”Computational Social Science”
  • Hey (2009):“第四范式”,大数据时代的科学研究不再需要模型和假设,而是利用超级计算能力直接分析海量数据发现相关关系即可获得知识
    • Empirical evidence
    • Scientific theory
    • Computational science
    • Data-intensive research
  • King (2016): 大数据方法将终结传统的定量、定性方法分野

计算·社会科学

新交叉学科

从海量数据中利用机器学习抽离出有价值的信息

  • 积累海量数据
  • 利用统计和数学知识 + 模式识别技术
  • 发现有意义的新关系、新模式或新趋势
  • 数据来源拓展:文本、图片、视频、空间地理……
  • 工具箱拓展: 机器学习
  • 研究问题拓展:大规模、复杂问题、新生议题

数据分析层次

描述分析 (数据科学手段)

关系分析 (计量经济学手段)

模式/规律学习 (社会科学手段)

因果推断 (跨学科手段)

描述

全球 Covid-19

Standardized World Income Inequality Database (Solt 2020)

关系分析

模式学习

1997

1997

1990

1990

规律学习

因果推断

举例:孔子学院关闭的因果效应

  • 得到Google Jigsaw的支持
  • 监控全球100多种语言的广播、印刷和网络新闻无处不在
  • 变量:人物、地点、组织机构、主题、来源、情感、计数、引语、图像和事件

Shutting-down vs. Ice cream

推断结果

小结

  • 大数据的分析价值:计算社会科学的产生
  • 计算社会科学 = 数据科学 + 社会科学
  • 数据分析的层次
    • 描述
    • 关系
    • 模式/规律
    • 因果

政务(大)数据分析方法与应用

大数据研究方法

  • 自然语言处理
  • 机器学习
  • 音频/视频/图片分析
  • 社会网络分析
  • 空间/时间分析
    ……

自然语言处理(Natural Language Processing)

  • 语言(自然语言)是人类获得信息和表达信息的重要载体之一
    • 计算语言学:NLP是使用自然语言与计算机进行通信的技术——从语料中产生知识
      • 信息抽取、实体识别、词性标注、句法分析、语音识别、机器翻译、自动文摘、信息检索等
      • 语言模型:描述自然语言内在规律的数学模型
      • 向量空间模型(Vector Space Model)、统计语言模型(N-gram)、字符嵌入(word embedding)

文化组学

  • 指通过电子化文本的量化分析研究人类行为与文化趋势的计算词典学方法,以研究人们使用的语言与词汇,进而揭示其中反应出来的文化现象。

机器学习

通过计算机编程实现比人工检索更的效果 (Samuel 2000)

  1. 收集数据
  2. 数据准备
  3. 选择一个模型
  4. 训练
  5. 评估
  6. 参数调整
  7. 预测

视频/图片分析(Gebru et al. 2017)

社会网络分析

空间分析

时间分析

时空比较

时空分析

政务大数据分析应用

  • 商情通:城市营商环境大数据动态感知平台
  • 民情通:人感城市智慧决策辅助系统

商情通:城市营商环境大数据动态感知平台

建设营商环境大数据动态感知平台,加速构建创营商环境新优势。通过打破政府数据壁垒,建立汇集基层政府治理、市场营造和企业发展等多维度数据信息系统平台,助力政府发现市场监管缺口和企业市场需求提供依据,进一步解决城市社会经济发展新要求。

指标设计原则

  1. 时代性与本土性原则;
  2. 多样性与代表性原则;
  3. 可靠性与时效性原则。

一级指标 设置目标 指标内涵
1.政府治理 衡量营商环境建构 与营商环境发展相关涉的制度建设和司法实践、廉政建设、城市安全等方面
过程中的政府法治
建设和城市运行情况
2.市场营造 衡量地方在服务市场商事主体、应对相关营商问题上的综合能力 涉及政府回应、劳动保障、基础运维、市场监督和经济纠纷化解等市场营造问题的地方应对能力
3.企业经营 衡量地方营商环境对企业发展的综合影响 促进以企业为代表的商事主体的生存、规模、经营水平的提升情况

商情数据驾驶舱

整合司法大数据、网络舆情大数据、政务热线大数据、企业营商大数据等数据资源,在此基础上进行大数据分析展示,分析营商热点,挖掘民声民意,以便快速的做出工作的响应。

案例:基于大数据分析的广州市营商环境评估研究

  • 项目受托方:中国发展研究基金会、广州市发改委。
  • 课题成果:
    • 以广州为中心个案,通过挖掘和说明政府、市场和企业维度下不同指标的营商环境意涵及其变动趋势特征,实现以把脉问诊形式评估2021年度广州营商环境的整体特征。
    • 以商情通的数据分析模块为依托,将时间颗粒度细化到月和日,对广州下辖的不同行政区县进行营商环境测量与评估。

民情通:人感城市智慧决策辅助系统

数字时代智慧城市的两种模式:

  • 物感城市(城市大脑、智慧城市、数字孪生)
    • 感知城市的客观世界、物理空间
    • 以物为中心、强技术依赖、运行成本高、中心化结构
  • 人感城市(接诉即办、市长直通车、粤省心)
    • 感知城市的主观世界、社会空间
    • 以人为中心、市民参与驱动、成本社会化、扁平化结构
    • 物感城市+人感城市:理解城市复杂系统的解决方案

人感城市 vs. 物感城市

感应方式 物感城市 人感城市
驱动来源 数字技术、物感数据 市民诉求、人感数据
感知范畴 物理系统、现象与行为 社会系统、意义与情感
参与主体 政府、科技企业 政企社多主体协同
治理结构 中心化、串联式 扁平化、并联式
优先目标 城市高效运行 以人民为中心

敏捷治理

建成市民诉求驱动的城市治理决策辅助系统,辅助政府感知社情民情,精准科学决策,促进政府回应效能升级。通过统筹规划、分步实施,逐步实现数据整合、业务融合,形成动态化决策辅助体系、开发自动化决策辅助报告平台,全面提升社会治理的数字化与智能化水平,赋能基层敏捷治理改革。

人感闭环

治理创新

人感城市的探索:北京“接诉即办”改革

十八届三中全会:“全面深化改革的总目标是完善和发展中国特色社会主义制度,推进国家治理体系和治理能力现代化”。

  • 2017年,“街乡吹哨,部门报到”
  • 2018年,“吹哨集合”改革试点
  • 2019年,“吹哨报到”全面铺开城市治理现代化改革
  • 2019年,“接诉即办”政务热线大数据成为超大城市治理抓手
  • 2020年,“接诉即办”升级,启动地方立法
  • 2021年,《北京市接诉即办工作条例》,市民诉求驱动的治理革命

链接市民与城市

“市民诉求驱动”超大城市治理:市民诉求数据体量巨大

  • 数据质量可靠:有事投诉、办事回应、督察回访
  • 民情诉求多样:市场服务、社会风险、民生服务
  • 群体覆盖广泛:积极市民、用户多样、底线保障

市民诉求驱动

  • 业务流程优化:围绕市民诉求,重塑回应流程
    • 以专业分工为基础的“串联式业务流程”-以市民诉求为中心的“并联式业务流程”
    • 政民互动关系:感知汇聚民意,事前主动回应
  • 主动识别民生问题的“矛盾集中点”、“关键风险点”和“病因产生点”,推动社会治理端口前移,从“被动回应”向“主动回应”转变
    • 考核激励机制:量化回应过程,激发回应动力
  • 推动“眼睛向上”的科层逻辑,转向“眼睛向下”的现代服务型政府

接诉即办全流程

人感数据:12345+网格化+社交媒体

城市感知:数据穿透

回应性评估

干预效果评估

问题诊断

问题鉴别

风险评估

小结

方法

  • 自然语言处理
  • 机器学习
  • 音频/视频/图片分析
  • 社会网络分析
  • 空间/时间分析

应用

  • 商情通
  • 民情通

政务(大)数据分析迷思与原则

大数据分析迷思

  1. 创新性迷思
  2. 伦理性迷思
  3. 合理性迷思

创新性迷思

问题导向 + 多元整合 + 社会科学思维

伦理性迷思

歧途:诱导

歧途:误导

合理性迷思

“每日上亿条”

“全网数据”

“《人民日报》所有文章”

大数据不是全数据

全数据不一定是好数据

破除合理性迷思

遵守

数据收集原则

研究设计原则

人才培养原则

数据收集:抽样

一大堆一小撮 ⇒ 代表性

简单随机抽样

  • SHA算法和MD5
  • 计算机随机数

复杂抽样

设计

  • 配额(quota)
  • 分组(clustering)
  • 分层(stratification)

复杂抽样

数据收集合理性

King, Pan, and Roberts (2017): 为了系统地描述他们的观点,我们从2010年到2015年的社交媒体帖子中获取了一个随机样本…… 从这些数据中,我们抽取了128个帖子,这些帖子是由人们……

Cirone and Hobbs (2022): 该分析仅限于随机样本的推文,我们收集了手工标注的数据……

  • 简单和复杂抽样是否适用于政务大数据?
  • 抽样偏差、数据来源冲突、波动增加、误差率…
  • “Let data talk”?

Data Never Talks

研究设计原则:科学性

[综合性决策部署要考虑方方面面的差异性,专项性决策部署要找准在全局中的合理定位,这些都需要充分熟悉情况、深入分析论证、科学把握尺度

——习近平 (《中央政治局的同志必须有很强的看齐意识》, 2015年12月)

如何科学?

信念

程序
方法

研究程序

问题导向

  1. 问题提出
  2. 理论假设
  3. 数据方法
  4. 实证检验

数据导向☆

  1. 观察数据
  2. 分析方法
  3. 规律总结
  4. 理论提升

研究指向

描述

已知 ⇒ 未知

  1. 无偏(正确😄)
  2. 高效(准确😅)

机制

搞清why & how

……

but how?

人才培养原则

  1. 知识基础
  2. 软硬件基础
  3. 认知基础

知识基础

典型对话:

负责人:我想在项目中使用大数据方法。我应该怎么做?

顾问:去学Python吧!!

知识基础

硬件基础

  • 网站HTML
  • RSS feeds
  • 网络社交媒体
  • 网络交易行为
    ……

  • 中国知网等数据库(期刊、报刊、年鉴等)
  • Google Books、百度学术
  • Google Trend、百度指数
  • JSTOR Data for Research……

软件基础

Python > R

  • API ports
  • Automation tools
  • Commercial usage

R > Python

  • Analysis
  • Visualization
  • Ecology

认知基础

小结

大数据分析迷思

  1. 创新性迷思
    • “新瓶”与“旧酒”
  2. 伦理性迷思
    • 诱导与误导
  3. 合理性迷思

破除合理性迷思

  • 数据收集原则
    1. 代表性原则
    2. 大数据抽样
  • 研究设计原则
    1. 科学:信仰 + 程序 + 方法
  • 人才培养原则
    1. 知识基础
    2. 软硬件基础
    3. 认知基础

感谢关注,欢迎交流

  sammo3182

  yuehu@tsinghua.edu.cn

  https://www.drhuyue.site

参考文献

Arthur, Charles. 2013. Tech giants may be huge, but nothing matches big data.” The Guardian, August. https://www.theguardian.com/technology/2013/aug/23/tech-giants-data.
Cirone, Alexandra, and William Hobbs. 2022. “Asymmetric Flooding as a Tool for Foreign Influence on Social Media.” Political Science Research and Methods, March, 1–12. https://doi.org/10.1017/psrm.2022.9.
Gärtner, Bernhard, and Martin R. W. Hiebl. 2017. “Issues with Big Data.” In The Routledge Companion to Accounting Information Systems. Routledge.
Gebru, Timnit, Jonathan Krause, Yilun Wang, Duyun Chen, Jia Deng, Erez Lieberman Aiden, and Li Fei-Fei. 2017. “Using Deep Learning and Google Street View to Estimate the Demographic Makeup of Neighborhoods Across the United States.” Proceedings of the National Academy of Sciences 114 (50): 13108–13. https://doi.org/10.1073/pnas.1700035114.
Goldston, David. 2008. Big data: data wrangling.” Nature 455 (7209): 15–15. https://doi.org/10.1038/455015a.
Hey, Tony. 2009. The Fourth Paradigm: Data-Intensive Scientific Discovery. Edited by Stewart Tansley and Kristin Tolle. 1st edition. Redmond, Washington: Microsoft Research.
King, Gary. 2016. “Preface: Big Data Is Not about the Data!” In Computational Social Science: Discovery and Prediction, edited by R. Michael Alvarez. Cambridge: Cambridge University Press. https://tinyurl.com/ya29nsge.
King, Gary, Jennifer Pan, and Margaret E. Roberts. 2017. “How the Chinese Government Fabricates Social Media Posts for Strategic Distraction, Not Engaged Argument.” American Political Science Review 111 (3): 484–501.
Lazer, David, Alex Pentland, Lada Adamic, Sinan Aral, Albert-László Barabási, Devon Brewer, Nicholas Christakis, et al. 2009. “Computational Social Science.” Science 323 (5915): 721–23. https://doi.org/10.1126/science.1167742.
Liu, Lizhi. 2021. “The Rise of Data Politics: Digital China and the World.” Studies in Comparative International Development 56 (1): 45–67. https://doi.org/10.1007/s12116-021-09319-8.
Michel, Jean-Baptiste, Yuan Kui Shen, Aviva Presser Aiden, Adrian Veres, Matthew K. Gray, The Google Books Team, Joseph P. Pickett, et al. 2011. “Quantitative Analysis of Culture Using Millions of Digitized Books.” Science 331 (6014): 176–82. https://doi.org/10.1126/science.1199644.
Palmer, Michael. 2006. “Data Is the New Oil.” ANA Marketing Maestros. https://ana.blogs.com/maestros/2006/11/data_is_the_new.html.
Samuel, A. L. 2000. “Some Studies in Machine Learning Using the Game of Checkers.” IBM Journal of Research and Development 44 (1.2): 206–26. https://doi.org/10.1147/rd.441.0206.
Science Staff. 2011. “Challenges and Opportunities.” Science 331 (6018): 692–93. https://doi.org/10.1126/science.331.6018.692.
Singh, Malvika. 2023. “Is Data Still the New Oil?” Medium. https://medium.com/@malvikasingh1411/is-data-still-the-new-oil-2e42b95335da.
The Economist. 2017. “The World’s Most Valuable Resource Is No Longer Oil, but Data.” The Economist, May. https://www.economist.com/leaders/2017/05/06/the-worlds-most-valuable-resource-is-no-longer-oil-but-data?gclid=EAIaIQobChMIwMK9r6L__wIVk6OWCh1w-QusEAAYASAAEgJNJ_D_BwE&gclsrc=aw.ds.