大数据在社会科学研究中的应用

胡悦

清华大学社会科学学院
清华大学计算社会科学平台

个人简介

个人经历

  • 政治科学博士(University of Iowa)
    • 信息学(Graduated Certificate in Informatics)
  • 清华大学计算社会科学平台(副主任)
    • 清华数据与治理中心(副主任)
    • 计算社会科学编程语言证书项目(创始人)

研究兴趣认知、行为与现代性

  • W. 数据科学
    • 实验室和调查实验
    • 潜变量分析、网络分析、空间分析
    • 文本大数据分析、数据可视化

研究领域

  • W. 心理学
    • 政治认知与行为
    • 政治传播
    • 身份政治(城乡、司法)
  • W. 经济学
    • 社会经济不平等感知
  • W. 语言学
    • 语言能力的政治影响
    • 语言政策的治理功能

课程概要

  1. 计算社会科学定位与沿革
  2. 计算社会科学原理与应用
  3. 计算社会科学科研实践转化
  4. 国家大数据战略治理实践探索
  5. 计算社会科学与国家安全

计算社会科学沿革与概要

什么是社会科学

社会科学是用科学的方法,研究人类社会的种种现象。

  • 政治学
  • 经济学
  • 社会学
  • 国际关系
  • 心理学
  • 行政学
  • 军事学
  • 统计学
  • 人类学
  • 民俗学
  • 公共关系学
  • 公共行政学
  • 犯罪学
  • 考古学
  • 教育学
  • 语言学
  • 社会工作
  • 新闻学
  • 传播学
  • 宗教学
  • 图书馆学
  • 区域研究
  • 发展研究
  • 环境研究
  • 性别研究
  • 媒体研究 ……

  • 马克思主义理论
  • 法学
  • 历史

大数据 → 社会科研

什么是大数据

Goldston (2008)

Goldston (2008)

人类社会的“快速、大尺度、深层次”数字化转型

  • 社会数字化—海量资源待处理
  • 数据科学—计算机辅助方法
  • 新生现象—理论、新范式

Science Staff (2011)

Science Staff (2011)

从政治层面理解大数据

  • 大数据是以容量大、类型多、存取速度快、应用价值高为主要特征的数据集合,正快速发展为对数量巨大、来源分散、格式多样的数据进行采集、存储和关联分析,从中发现新知识、创造新价值、提升新能力的新一代信息技术和服务业态。(国务院 2015)
  • 数据已成为国家基础性战略资源(十三五)
  • 数据是重要生产要素(十九届四中全会)
  • 加快构建数字技术辅助政府决策机制,提高基于高频大数据精准动态监测预测预警水平。强化数字技术在公共卫生、自然灾害、事故灾难、社会安全等突发公共事件应对中的运用,全面提升预警和应急处置能力。(十四五)

大数据优势 (Stewart 2020)

大数据特点

大数据是指需要新处理模式才能确保更强的决策力、洞察力和流程优化力的海量、高速增长和多样化的信息财富 (Gärtner and Hiebl 2017)

以(大)数据为对象的科研

数据科学发展沿革

计算社会科学

“计算社会科学”这一研究领域正在兴起,人们将在前所未有的深度和广度上自动地收集和利用数据,为社会科学的研究服务。社会计算是指社会行为和计算系统交叉融合而成的一个研究领域,研究的是如何利用计算技术帮助人们进行沟通与协作,如何利用计算技术研究社会运行的规律与发展趋势

学科交叉

  • Lazer et al. (2009): 15位美国学者在Science上联合发表里程碑意义文章”Computational Social Science”
  • Hey (2009):“第四范式”,大数据时代的科学研究不再需要模型和假设,而是利用超级计算能力直接分析海量数据发现相关关系即可获得知识
    • Empirical evidence
    • Scientific theory
    • Computational science
    • Data-intensive research
  • King (2016): 大数据方法将终结传统的定量、定性方法分野

计算·社会科学

新交叉学科

从海量数据中利用机器学习抽离出有价值的信息

  • 积累海量数据
  • 利用统计和数学知识 + 模式识别技术
  • 发现有意义的新关系、新模式或新趋势
  • 数据来源拓展:文本、图片、视频、空间地理……
  • 工具箱拓展: 机器学习
  • 研究问题拓展:大规模、复杂问题、新生议题

计算社会科学原理与系统

核心特征

范式转换的八个特征

  1. 数据生成机制:海量非结构化数据、消极数据
  2. 数据代表性:“全量数据”而不是“样本数据”
  3. 数据驱动范式:丰富、高效的方法工具箱
  4. 预测性研究:机器学习提升预测能力
  5. 知识消费:强时效性数据+知识
  6. 开放科学 / 志愿科学共同体
  7. 社会科学知识平民化普及
  8. 良好的组织环境 + 充分的社会需求

研究流程

方法树

常用方法

  • 自然语言处理
    • 音频分析
    • 视频/图片分析
  • 社会网络分析
  • 空间/时间分析
  • 可视化*

自然语言处理(Natural Language Processing)

  • 语言(自然语言)是人类获得信息和表达信息的重要载体之一
    • 计算语言学:NLP是使用自然语言与计算机进行通信的技术——从语料中产生知识
      • 信息抽取、实体识别、词性标注、句法分析、语音识别、机器翻译、自动文摘、信息检索等
      • 语言模型:描述自然语言内在规律的数学模型
      • 向量空间模型(Vector Space Model)、统计语言模型(N-gram)、字符嵌入(word embedding)

生成条件

  • 大规模文本数据采集;
  • 存储和管理能力增强;
  • 文本分析方法蓬勃发展;
  • 文本资料指数级增长;
  • 通过文本表达的社会意义更广泛。

表层语言学分析

现实与关注

文化组学

  • 指通过电子化文本的量化分析研究人类行为与文化趋势的计算词典学方法,以研究人们使用的语言与词汇,进而揭示其中反应出来的文化现象。

应用:国家认同

Google books 1760 - 2011

社会语言学

Linguistic Inquiry and Word Count(LIWC)

LIWC树

宗教背景与词汇选择

概念化比喻(Conceptual Metaphors)

应用

语言处理三大挑战

  1. 非结构化:文本数据是典型的非结构化数据

  1. 高维数据:所有语言的各种可能词语和短语等
  2. 语言复杂性:文本中词语之间复杂且微妙的关系

高纬度数据

处理高纬度数据

应用

1991

1991

1997

1997

“一以贯之”

语言复杂性

  • 文本中词语之间复杂且微妙的关系;
  • 词语模糊性和情景敏感性;
  • 一词多义vs多词同义

建模语言复杂性

词汇 → 向量

破拆语言

机器学习

通过计算机编程实现比人工检索更的效果 (Samuel 2000)

  1. 收集数据
  2. 数据准备
  3. 选择一个模型
  4. 训练
  5. 评估
  6. 参数调整
  7. 预测

深度学习

应用:从文字到情绪

情感变化曲线

音频分析 (Dietrich, Hayes, and O’Brien 2019)

74,158 Congressional floor speeches

视频/图片分析(Yee, Tantipongpipat, and Mishra 2021)

街景图片分析(Gebru et al. 2017)

眼球竞争

社会网络分析

圈子分析

政府间关系

政党关系

小世界

饭圈

空间分析

时间分析

时空比较

时空分析

基于时空的因果推断

值得注意

计算社会科学科研实践转化

顶层设计

  • 2013-09-30:第18届政治局第9次集体学习
    • 主题:“实施创新驱动发展战略”
      • 百度创始人兼CEO李彦宏作为创新企业代表讲解了信息技术领域的前沿课题——大数据的发展情况
    • 机会稍纵即逝,抓住了就是机遇,抓不住就是挑战。必须增强忧患意识,紧紧抓住和用好新一轮科技革命和产业变革的机遇,不能等待、不能观望、不能懈怠

2017-12-08:第19届政治局第2次集体学习

  • 主题:“实施国家大数据战略”
  • 大数据发展日新月异,我们应该审时度势、精心谋划、超前布局、力争主动,深入了解大数据发展现状和趋势及其对经济社会发展的影响,分析我国大数据发展取得的成绩和存在的问题,推动实施国家大数据战略,加快完善数字基础设施,推进数据资源整合和开放共享,保障数据安全,加快建设数字中国,更好服务我国经济社会发展和人民生活改善。要审时度势精心谋划超前布局力争主动,实施国家大数据战略,加快建设数字中国。各级干部要懂得用好大数据。

2018-10-31: 第19届政治局第9次集体学习

  • 主题: “人工智能发展现状和趋势”
  • 人工智能是新一轮科技革命和产业变革的重要驱动力量,加快发展新一代人工智能是事关我国能否抓住新一轮科技革命和产业变革机遇的战略问题。要深刻认识加快发展新一代人工智能的重大意义,加强领导,做好规划,明确任务,夯实基础,促进其同经济社会发展深度融合,推动我国新一代人工智能健康发展。要加强人工智能同社会治理的结合,开发适用于政府服务和决策的人工智能系统,加强政务信息资源整合和公共需求精准预测,推进智慧城市建设,促进人工智能在公共安全领域的深度应用,加强生态领域人工智能运用,运用人工智能提高公共服务和社会治理水平。

2024-01-31: 第20届政治局第11词集体学习

  • 主题:“加快发展新质生产力 扎实推进高质量发展”
  • 要根据科技发展新趋势,优化高等学校学科设置、人才培养模式,为发展新质生产力、推动高质量发展培养急需人才。要健全要素参与收入分配机制,激发劳动、知识、技术、管理、资本和数据等生产要素活力,更好体现知识、技术、人才的市场价值……

大数据驱动的国家治理现代化

  • 2015年《促进大数据发展行动纲要》、国家大数据战略(十三五规划)
  • 数字中国战略(十九大)
  • 数据是重要生产要素(十九届四中全会)
  • 数字政府:经济与社会数字化的基础设施(十四五规划)

“大数据发展日新月异,我们应该审时度势、精心谋划、超前布局、力争主动”,要“运用大数据升国家治理现代化水平”,要“利用大数据平台,分析风险因素,提高感知、预测、防范能力”;要“运用大数据促进保障和改善民生,利用‘互联网+N’推进教育、就业、社保、医药卫生、住房、交通等领域大数据普及应用。(十九届中央政治局专门就实施大数据国家战略的第2次集体学习)

国家大数据战略

《数字中国建设整体布局规划》

2023-02-27, 中共中央 国务院

拥有大数据发展的世界视野

国家大数据战略治理实践探索

治理与军队发展的高站位

高层机关和高级干部要带头解放思想,创新工作方式,以治理的理念推进各项工作,增强系统治理、依法治理、综合治理、源头治理本领。要高度重视基层治理,尊重官兵主体地位和首创精神,推动基层建设全面进步、全面过硬。要把军事治理同改革和法治有机结合起来,巩固拓展国防和军队改革成果,深化军事立法工作,强化法规制度实施和执行监督,发挥好改革的推动作用,用好法治这个基本方式,更好推进军事治理各项工作。(第二十届中共中央政治局第7次集体学习,2023-07-24,“全面加强军事治理 以高水平治理推动我军高质量发展”)

计算社会科学融入治理实践案例

  • 城感通:城市治理及公共决策风险防范系统
  • 社情通:社会治理效能提升的智能化解决方案

城感通:城市治理及公共决策风险防范系统

物感 + 人感

物感 + 人感

建立城市社会风险预警处置平台,加强城市应急管理与风险管控工作。通过进一步拓展完善“一网通管”体系,汇集政府监测数据、民生反馈数据和社会舆情数据,实现突发事件实时感知,舆论整体态势预研预控,转办督办工作方案的制定。促进城市治理、智慧城市建设、风险防范体系建设,提升政务机构服务响应和满意度。

突发事件感知

  • 舆论危机发现要早,尽量在苗头期迅速处置
  • 舆论环境瞬息万变,须及时掌握变化情况

感知途径和作用

多模态感知诊断

舆论态势感知

通过系列指数全面呈现某个区域整体舆论环境

通过系列指数全面呈现某个区域整体舆论环境

舆论感知指数化

指数搭建

服务搭建

转办督办工作台

舆情事件风险等级、信息分类、组织结构设置均可自由配置

舆情事件风险等级、信息分类、组织结构设置均可自由配置

处置结果大屏展示

社情通:社会治理效能提升的智能化解决方案

打造基层治理矛盾感知与风险化解平台,助力地方精准施策与精细管理,提升基层社会治理效能。 打造“区级-街道-社区-网格-小区”五级联动一体化信息处置平台,建设基层综合业务系统,通过建设智能政务客户端、政务引导机器人、政务一体化办理机等多端为基层治理提供智能化、精准化服务,实现基层治理服务智能化运营,提升居民政务体验满意度,提升基层治理的精细化、数字化、智能化。

  • 社情民意诉求:12345诉求数据、网络舆情数据等
  • 治理资源诉求:人员、资金、空间等
  • 数据质量:事项分类、时间颗粒度、空间颗粒度、诉求内容完整度和准确度
  • 数据特征:实时性、追踪性、穿透性

以街道为基础层级的精确治理

基于数据源特性,进行分类数据源平台整合,汇同新浪微博等社交媒体数据,形成街道社会治理大数据集 (成果:201908-202108历史性数据)。

  1. 市民民生反馈平台数据源——某市12345平台
  2. 政府网民互动平台数据源——网络论坛+公众监督
  3. 公众信访服务平台数据源——阳光信访+线下来访+领导信箱(市长、园区主任、园区书记)

技术框架

技术框架

应用分析指标体系

全景分析 + 风险感知

在集合层次上发现民生诉求治理难易的地区差异与时间周期特征,通过大数据智能筛选方式,形成诉求扬言风险指数,建立风险指数公式。

清河实验2.0

  • 利用微信平台方式,征求居民对于公共空间改善的意见,并搜集有效的提案,为街道的公共空间改善提出具体方案与建议。
  • 打造一个居住工作环境上“有品质”、民生关怀上“有温度”、街区治理创新上“有活力”的 “人文新清河”

计算社会科学与国家安全

宏观安全:战略资源

  • 战略属性
    • 体量
    • 属性
  • 分析价值

微观安全:认知渗透

可能的应用场景

  1. 数据辅助决策:分析大数据集以发现模式和趋势,根据历史数据优化部署或供应链。
  2. 社交网络分析:社交网络分析通信、动员、组织网络,帮助识别关键节点和脆弱性。
  3. 自然语言处理:诊断认知动向,推动管理现代化、高效化。
  4. 数字追踪技术:追踪内部信息,判断潜在外部威胁和渗透。
  5. 情景反应预判:人感信息纳入,情境反应预估、预备、预防

感谢关注,欢迎交流

  sammo3182

  yuehu@tsinghua.edu.cn

  https://www.drhuyue.site

参考文献

Bengio, Yoshua, Réjean Ducharme, and Pascal Vincent. 2000. “A neural probabilistic language model.” In Advances in Neural Information Processing Systems. Vol. 13. MIT Press.
Dietrich, Bryce J., Matthew Hayes, and Diana Z. O’Brien. 2019. “Pitch Perfect: Vocal Pitch and the Emotional Intensity of Congressional Speech.” American Political Science Review, Forthcoming.
Gärtner, Bernhard, and Martin R. W. Hiebl. 2017. “Issues with Big Data.” In The Routledge Companion to Accounting Information Systems. Routledge.
Gebru, Timnit, Jonathan Krause, Yilun Wang, Duyun Chen, Jia Deng, Erez Lieberman Aiden, and Li Fei-Fei. 2017. “Using Deep Learning and Google Street View to Estimate the Demographic Makeup of Neighborhoods Across the United States.” Proceedings of the National Academy of Sciences 114 (50): 13108–13. https://doi.org/10.1073/pnas.1700035114.
Goldston, David. 2008. “Big data: data wrangling.” Nature 455 (7209, 7209): 15–15. https://doi.org/10.1038/455015a.
Hey, Tony. 2009. The Fourth Paradigm: Data-Intensive Scientific Discovery. Edited by Stewart Tansley and Kristin Tolle. 1st edition. Redmond, Washington: Microsoft Research.
King, Gary. 2016. “Preface: Big Data Is Not about the Data!” In Computational Social Science: Discovery and Prediction, edited by R. Michael Alvarez. Cambridge: Cambridge University Press.
Lazer, David, Alex Pentland, Lada Adamic, Sinan Aral, Albert-László Barabási, Devon Brewer, Nicholas Christakis, et al. 2009. “Computational Social Science.” Science 323 (5915): 721–23. https://doi.org/10.1126/science.1167742.
Michel, Jean-Baptiste, Yuan Kui Shen, Aviva Presser Aiden, Adrian Veres, Matthew K. Gray, The Google Books Team, Joseph P. Pickett, et al. 2011. “Quantitative Analysis of Culture Using Millions of Digitized Books.” Science 331 (6014): 176–82. https://doi.org/10.1126/science.1199644.
Pennington, Jeffrey, Richard Socher, and Christopher Manning. 2014. “GloVe: Global Vectors for Word Representation.” In Proceedings of the 2014 Conference on Empirical Methods in Natural Language Processing (EMNLP), 1532–43. Doha, Qatar: Association for Computational Linguistics. https://doi.org/10.3115/v1/D14-1162.
Samuel, A. L. 2000. “Some Studies in Machine Learning Using the Game of Checkers.” IBM Journal of Research and Development 44 (1.2): 206–26. https://doi.org/10.1147/rd.441.0206.
Science Staff. 2011. “Challenges and Opportunities.” Science 331 (6018): 692–93. https://doi.org/10.1126/science.331.6018.692.
Stewart, Jon, dir. 2020. Irresistible (2020). United States: Plan B Entertainment, Busboy Productions, Focus Features.
Yee, Kyra, Uthaipon Tantipongpipat, and Shubhanshu Mishra. 2021. “Image Cropping on Twitter: Fairness Metrics, Their Limitations, and the Importance of Representation, Design, and Agency.” Proceedings of the ACM on Human-Computer Interaction 5 (October): 450:1–24. https://doi.org/10.1145/3479594.