共计 1433 个字符,预计需要花费 4 分钟才能阅读完成。
关键词共现聚类的学术价值
关键词共现聚类分析是文献计量学中揭示学科知识结构的核心方法。通过统计文献关键词的共现频率,CiteSpace 可生成反映研究热点与演进路径的科学知识图谱。其价值主要体现在三方面:

- 识别研究热点:高频共现关键词群反映学科关注焦点
- 发现知识关联:节点间的连线揭示跨领域研究主题的联系
- 追踪演进趋势:时区视图呈现研究主题的兴衰变化
新手常见痛点分析
1. 数据格式错误
WOS 导出的纯文本数据常因编码格式或字段缺失导致 CiteSpace 解析失败。典型问题包括:
- UTF- 8 编码未保存
- 作者字段包含特殊字符
- 参考文献行未完整导出
2. 聚类效果差
- 节点过度拥挤(修剪参数不当)
- 聚类边界模糊(相似度阈值设置不合理)
- 关键节点缺失(数据清洗过度)
3. 图谱解读困难
- Q 值 >0.3 但聚类结构不清晰
- 高中心性节点无实际学术意义
- 时区演进路径断裂
技术解决方案
数据预处理(Python 示例)
import pandas as pd
# 读取 WOS 导出文件
df = pd.read_csv('savedrecs.txt', sep='\t', encoding='utf-8')
# 关键字段清洗
def clean_text(text):
return str(text).replace('α','alpha').replace('®','').strip()
df['DE'] = df['DE'].apply(clean_text) # 处理关键词字段
df['CR'] = df['CR'].apply(lambda x: x[:500] if len(str(x))>500 else x) # 截断过长参考文献
# 保存为 CiteSpace 兼容格式
df.to_csv('processed_data.txt',
sep='\t',
index=False,
encoding='utf-8-sig',
columns=['PT','AU','TI','SO','DE','CR','PY'])
CiteSpace 参数配置
- 时区分割
- 建议按 3 - 5 年划分时段
-
选择 ”Top N per slice” 保持各时段数据均衡
-
节点类型
- Keyword 分析选择 ”Term” 而非默认 ”Author”
-
勾选 ”Remove duplicate terms”
-
修剪算法
- Pathfinder+Pruning sliced networks 组合效果最佳
- Minimum Spanning Tree 适用于小数据集
可视化优化技巧
- 节点大小 :按中介中心性(Betweenness) 而非频次调整
- 颜色映射:使用 ”Time Zone” 模式显示演进趋势
- 标签显示:开启 ”Label Clusters by LLR” 自动标注聚类主题
避坑指南
WOS 数据导出注意事项
- 选择 ”Full Record and Cited References” 导出层级
- 导出格式务必为 ”Tab-delimited (Win)”
- 单次导出记录建议不超过 2000 条
特殊字符处理
- 数学符号:在 Python 预处理阶段统一替换
- 版权符号:使用正则表达式
re.sub(r'[©®™]', '', text) - 希腊字母:转为英文拼写(如 α→alpha)
结果解读要点
- 模块度(Q 值)
-
0.3 表示显著聚类结构
-
<0.2 需检查数据质量
-
轮廓值(Silhouette)
-
0.5 说明聚类内部一致性高
- 结合 LLR 标签判断主题区分度
延伸思考
- 如何通过时区视图识别新兴研究主题?
- 当 Q 值高但轮廓值低时,应如何优化聚类参数?
- 对比 Pathfinder 和 MST 算法生成的网络结构差异
(注:因平台限制,示意图需读者自行补充 CiteSpace 界面截图和流程图)
正文完
