电子书 数据分析

[中英对照] 基于 Python 的数据挖掘话语分析:心理治

¥3.50 已售 0
✓ 自动发货 ✓ 永久有效 ✓ 售后保障

资源介绍

疗对话案例研究(双语对照版电子书) 主要内容架构 全书共 6 章,结构清晰且逻辑连贯,每章均遵循 “技术讲解 - 案例研究 - Python 代码注释” 的统一框架,便于读者理解与实践。 (一)导论章节(第 1 章) 本章首先明确了数据挖掘的定义与核心特质,指出数据挖掘是涵盖问题构建、数据收集、假设检验到结果解读的整体性、情境化过程,而非单纯的统计方法应用。同时,详细阐述了数据挖掘在话语分析中的优势,包括客观性、可扩展性、数据丰富性、创新性、灵活性与跨学科性等。 在语言量化方法上,本书介绍了两种关键方式:一是词嵌入技术,通过将语言映射为数值向量,捕捉语义与句法特征,像基于词频的向量表示、tf - idf 加权等,还提及可借助主成分分析(PCA)对高维向量进行降维处理,方便后续分析与可视化;二是 LIWC(语言查询与字数统计)评分,该工具能计算文本中约 90 个语言类别的标准化频率,并生成四个核心总结变量 —— 分析思维、影响力、真实性与情感基调,这些变量从社会心理层面反映语言特征,更贴合心理治疗对话的分析需求。 此外,本章还简要介绍了 Python 语言的基础操作,包括库的导入、数据文件的读取与处理等,为读者后续学习打下编程基础。 (二)核心技术章节(第 2 - 5 章) 蒙特卡洛模拟(第 2 章) 蒙特卡洛模拟是应对不确定性的有效工具,其核心思路是通过大量模拟不确定现象的可能结果,分析结果的概率分布,进而对现象进行推断。本章以生日问题、赌场轮盘赌等经典案例引入,帮助读者理解模拟的基本逻辑。 在心理治疗话语分析场景中,该技术主要用于解决转录文本缺失问题。由于技术故障、来访者拒绝授权等原因,心理治疗会话的转录文本常出现缺失,给研究与实践带来阻碍。书中案例以一组包含 40 个完整心理分析会话转录文本的数据集为例,通过 “训练 - 测试” 方法,将 75% 的文本作为训练数据,基于其 LIWC 评分的统计特性(均值、标准差等),模拟缺失的 25% 文本的 LIWC 评分,并通过与实际缺失文本评分的对比验证模拟效果。同时,还探讨了不同治疗阶段文本缺失时模拟的准确性差异,为实际应用提供更细致的参考。 聚类分析(第 3 章) 聚类分析旨在将具有相似属性的对象归为一类,使同类对象相似度最大化、不同类对象相似度最小化。本章对比介绍了层次聚类(以凝聚层次聚类为例)与非层次聚类(以 k - 均值聚类为例)两种主要算法,并重点演示了 k - 均值聚类在心理治疗对话分析中的应用 —— 衡量治疗师与来访者的语言同步性。 语言同步性是人际同步性的重要组成部分,指治疗师与来访者在语言选择上的契合程度。书中以三个不同治疗流派(心理分析、认知行为治疗、人本主义治疗)的治疗师 - 来访者组合(每组合包含多节会话)为研究对象,先将每节会话转录文本拆分为治疗师与来访者各自的子文本,计算子文本的 LIWC 评分,再通过 k - 均值聚类对这些子文本进行分组。若某节会话中治疗师与来访者的子文本被分到同一聚类,则认为该节会话中双方语言同步;反之则不同步。通过统计同步会话在总会话中的占比,可得到每组治疗师 - 来访者的语言同步性指标,为分析不同治疗流派的语言互动特征提供依据。 分类分析(第 4 章) 分类分析属于有监督机器学习范畴,核心是基于对象的属性预测其所属类别。本章以 k 近邻算法(k - NN)为例,介绍了分类技术在心理治疗话语分析中的应用 —— 根据治疗对话语言特征预测治疗类型。 书中选取 150 个随机抽取的治疗会话转录文本(涵盖心理分析、认知行为治疗、人本主义治疗三种类型,每种类型 50 个文本),以文本的 LIWC 评分为预测特征,以治疗类型为目标类别,通过 k - 近邻算法构建分类模型。首先通过 “训练 - 测试” 数据分割与交叉验证等方法确定最优的 k 值(近邻数量),再基于最优模型评估其预测准确率。同时,还通过精确率、召回率、F1 分数等指标,细致分析模型在不同治疗类型上的预测表现,为判断语言特征对治疗类型的区分能力提供全面依据。 时间序列分析(第 5 章) 时间序列分析主要用于分析随时间变化的数据,挖掘数据的时间规律并进行预测。本章以 ARIMA(自回归积分移动平均)模型为核心,介绍了时间序列分析的基本原理与步骤,并将其应用于心理治疗对话语言特征的建模与预测。 考虑到心理治疗会话通常按周进行,前后会话间可能存在语言上的关联,书中以某认知行为治疗案例中治疗师与来访者的分析思维 LIWC 评分(共 40 节会话)为研究对象,开展时间序列分析。首先检验数据的平稳性(若数据非平稳则进行差分处理),再通过计算自相关函数(ACF)与偏自相关函数(PACF)确定 ARIMA 模型的阶数,随后基于训练数据(前 37 节会话)拟合模型,利用测试数据(后 3 节会话)评估模型预测效果,最后通过残差诊断检验模型是否充分提取了数据中的时间规律。通过该模型,不仅能揭示治疗师与来访者分析思维语言特征随时间变化的规律,还能对未来会话中的相关语言特征进行预测,为治疗过程监控与预后评估提供支持。 (三)结论章节(第 6 章) 本章对全书内容进行总结,将数据挖掘比作 “步枪” 与 “铲子”——“步枪” 象征其精准解决特定话语分析问题的能力,“铲子” 则体现其挖掘新研究方向、发现意外研究线索的探索价值。同时,书中还探讨了数据挖掘技术在其他话语语境(如媒体话语、政治话语、教育话语等)中的应用潜力,提出了将多种数据挖掘技术结合应用于同一研究项目的思路,并鼓励读者在现有基础上进一步探索数据挖掘在话语分析领域的深度应用。 三、特色与亮点 理论与实践紧密结合:书中不仅清晰阐述数据挖掘技术的理论原理,还通过具体的心理治疗对话案例,详细展示技术的应用流程,使读者既能理解 “为什么”,又能掌握 “怎么做”。 代码注释详尽易懂:每章末尾均提供完整且带有详细注释的 Python 代码,读者可直接参考这些代码,结合自身研究数据开展实践,降低了技术应用的门槛。 跨学科视角鲜明:融合了语言学、心理学、数据科学等多个学科的知识,为不同学科背景的读者提供了交叉研究的思路与方法,推动话语分析学科的跨领域发展。 兼顾研究与实践需求:内容设计既满足话语研究者对新研究方法的需求,能助力其拓展研究视野、提升研究水平;又为心理治疗实践者提供了基于数据的自我反思与专业提升工具,具有很强的实用价值。