共计 1079 个字符,预计需要花费 3 分钟才能阅读完成。
背景介绍:为什么需要 CiteSpace 聚类图?
CiteSpace 作为文献计量分析的经典工具,能通过聚类图直观展示学科知识结构。聚类图的价值在于:

- 揭示研究领域的知识基础与前沿热点
- 识别关键文献和学术共同体
- 追踪学科演进路径和发展趋势
数据准备:WoS/CNKI 数据导出规范
数据导出步骤
- 在 Web of Science 高级检索界面设置检索式
- 勾选目标文献后选择『导出』→『纯文本文件』
- 记录内容选择『全记录与引用的参考文献』
- 文件格式务必选择『制表符分隔(Win)』
常见数据问题处理
使用 Python 清洗 WoS 数据的代码示例:
import pandas as pd
def clean_wos_data(filepath):
# 处理 UTF- 8 编码问题
df = pd.read_csv(filepath, sep='\t', encoding='utf-8', error_bad_lines=False)
# 删除空作者记录
df = df[df['AU'].notna()]
# 统一年份格式
df['PY'] = pd.to_numeric(df['PY'], errors='coerce')
return df
参数配置详解
关键参数设置策略
- 时间切片
- 建议按 3 - 5 年划分时间段
-
早期数据量少时可适当延长切片
-
节点类型
- 作者合作网络选『Author』
- 机构合作选『Institution』
-
关键词共现选『Term』
-
修剪算法
- Pathfinder:保留关键连接
- MST:生成最小生成树
- 初学者建议先用默认设置
可视化优化技巧
布局调整
- 节点大小:反映文献中心性
- 标签阈值:一般设为 30-50
- 颜色映射:使用色盲友好配色
解决标签重叠
- 调整『Label Font Size』
- 启用『Hide Small Labels』
- 手动拖动重叠标签
结果解读方法论
聚类标签生成原理
- LLR 算法提取特征词
- TF-IDF 加权计算
- 可自定义标签来源(标题 / 摘要 / 关键词)
关键指标解读
- Modularity Q > 0.3 表示聚类结构显著
- Mean Silhouette > 0.5 说明聚类合理
常见问题解决方案
| 问题现象 | 解决方法 |
|---|---|
| 空聚类 | 调低 g -index 值 |
| 节点过密 | 增加 Pathfinder 参数 |
| 标签缺失 | 检查 Term Source 设置 |
进阶应用组合
- 时区图
- 显示研究主题随时间演变
-
需设置『Timezone』视图
-
突现词检测
- 识别突然增长的研究热点
- 配合 Burstness 指标分析
实践任务
- 尝试比较 Pathfinder 与 MST 算法的可视化差异
- 用同一数据集生成作者合作与机构合作两种网络
- 调整 Q 值观察聚类数量变化规律
通过本指南的系统实践,相信你能制作出兼具学术价值与视觉表现力的聚类图。建议初次使用时保存不同参数配置的结果,逐步积累参数敏感度的经验。
正文完
