共计 1312 个字符,预计需要花费 4 分钟才能阅读完成。
数据预处理:从失败案例说起
最近协助一位同学分析教育技术领域文献时,发现其聚类结果出现大量乱码节点。经检查发现原始数据来自 CNKI,但导出时未选择 UTF- 8 编码。这种编码错误会导致 CiteSpace 无法正确解析中文字符,进而产生无效聚类。
正确数据准备流程
- WoS/CNKI 数据导出规范
- Web of Science 导出时勾选 ”Full Record and Cited References”
- 文件格式选择 ”Tab-delimited (Win)”
-
编码类型必须为 UTF-8(中文文献特别注意)
-
Python 预处理脚本示例
# -*- coding: utf-8 -*- import pandas as pd def clean_data(input_path): try: # 处理 WoS 导出的制表符分隔文件 df = pd.read_csv(input_path, delimiter='\t', encoding='utf-8') # 过滤无效记录(如无关键词的文献)df = df[df['DE'].notna()] # DE 列存储关键词 # 保存为 CiteSpace 兼容格式 df.to_csv('cleaned_data.txt', sep='\t', index=False) except UnicodeDecodeError: print('检测到编码错误!请确认原始文件为 UTF- 8 格式')
参数优化:时间切片与网络修剪
Time Slicing 设置建议
| 研究时期跨度 | 单切片时长 | 网络密度阈值 |
|---|---|---|
| 5 年以内 | 1 年 | 0.5-0.7 |
| 5-10 年 | 2 年 | 0.3-0.5 |
| 10 年以上 | 3- 5 年 | 0.1-0.3 |
网络修剪效果对比

– Pathfinder:保留重要连接,适合趋势分析
– Minimum Spanning Tree:最简连接,适合结构识别
时间轴视图深度解析
突现检测 (Burst Detection) 原理
- Kleinberg 算法检测关键词频率突变
- 计算爆发强度 (Burst Strength) 和持续时间
- 通过颜色渐变反映热点演进(红色 = 近期活跃)
关键节点识别技巧
- 中介中心性(Betweenness Centrality)>0.1
- 出现频次 (Frequency) 位于前 10%
- 连接多个聚类社区的桥梁节点
中文文献处理特别指南
CSSCI 字段映射
# 中文文献机构字段转换示例
df['AU'] = df['作者'].str.replace(';', ';') # 中文分号转英文
内存优化方案
- 分批处理:设置 Node Type 为 ”Keyword”+”Term”
- 调整 Memory 设置为 ”High”(需 8GB 以上内存)
- 使用 GPU 加速选项(CiteSpace 6.2.R4+ 版本)
COVID-19 案例复现包
练习数据集包含 2019-2023 年公共卫生文献,参数模板已预设:
# timeslice.def
Time Slicing = 2019-2023/1
Pruning = Pathfinder + MST
Node Types = Keyword
通过上述流程,可清晰观察到研究热点从初期 ” 病毒溯源 ” 转向后期 ” 疫苗研发 ” 的完整演进路径。建议先用这个标准案例熟悉工具,再迁移到自己的研究领域。
掌握这些核心技巧后,相信你能更高效地挖掘文献中的知识演进规律。如果在实践过程中遇到特殊问题,欢迎在学术社区分享你的处理经验。
正文完
