共计 1159 个字符,预计需要花费 3 分钟才能阅读完成。
背景介绍
关键词聚类分析是科学计量学中揭示研究热点和知识结构的核心方法。通过 CiteSpace 这类工具,我们可以将海量文献数据转化为直观的知识图谱。但新手常遇到三个典型问题:

- 数据格式错误:直接使用未经处理的原始导出数据
- 参数盲选:不理解时间切片和修剪算法的实际影响
- 读图困难:无法正确解读聚类模块度等关键指标
数据准备阶段
1. 数据导出规范
以 Web of Science 为例,正确的导出步骤:
- 在 WoS 检索结果页面勾选目标文献
- 点击 ” 导出 ” 选择 ” 纯文本文件 ” 格式
- 记录内容选择 ” 全记录与引用的参考文献 ”
- 导出文件建议命名为
wos_01.txt格式
2. 数据清洗要点
常见问题处理方案:
- 作者名消歧:在 CiteSpace 中勾选 ”Remove duplicate authors”
- 机构标准化:提前用 Excel 统一机构缩写(如 ”MIT” 和 ”Massachusetts Inst Tech” 需统一)
- 编码问题:中文数据需保存为 UTF- 8 格式
操作流程详解
1. 新建项目
- 启动 CiteSpace 点击 ”New”
- 项目命名建议包含日期(如
202405_LiteratureReview) - 数据路径选择存放 txt 文件的文件夹
2. 关键参数设置
- 时间切片(Time Slicing):
- 新手建议设为 1 年 / 切片
-
总跨度不超过 10 年(避免内存溢出)
-
节点类型(Node Types):
-
关键词聚类选择 ”Term” 和 ”Keyword”
-
修剪算法:
- 初始分析用 Pathfinder
- 复杂网络可试用 MST
可视化优化技巧
1. 聚类标签调整
// 在 CiteSpace 配置文件中修改
cluster.labeling = 0.7 // 标签显示阈值
label.font = 12 // 字体大小
2. 图谱美化
- 色彩方案:
- 菜单栏选择 ”View”→”Color Schema”
-
学术报告推荐 ”Cold” 色系
-
布局优化:
- 多次点击 ”Layout” 让节点均匀分布
- 拖拽重要聚类到中心位置
结果解读方法
1. 关键指标
| 指标 | 合格标准 | 优化建议 |
|---|---|---|
| Q 值 | >0.3 | 调整修剪参数 |
| S 值 | >0.5 | 增加时间切片精度 |
2. 典型图谱案例
- 星型结构:存在核心研究主题
- 多簇分散:领域尚未形成共识
避坑指南
1. 内存问题
解决方案:
- 菜单选择 ”Option”→”Memory”
- 将 Heap Size 调整为 2048MB 以上
2. 中文乱码
处理步骤:
- 用 Notepad++ 打开数据文件
- 选择 ” 编码 ”→” 转为 UTF-8″
- 保存后重新导入
3. 结果不稳定
优化策略:
- 相同参数重复运行 3 次
- 取 Q 值最高的一次结果
练习与自测
测试数据集:
– 提供 5 篇示范文献的预处理数据(下载链接)
自测问题:
1. 当 Q 值 <0.3 时应优先调整哪个参数?
2. 如何判断两个关键词是否属于同一聚类?
3. 遇到 ”Java heap space” 报错该怎么处理?
最后建议新手先使用自带样例数据练习,熟悉流程后再处理自己的研究数据。每次调整参数后建议保存项目副本,方便回溯比较不同设置的结果差异。
正文完
