共计 1176 个字符,预计需要花费 3 分钟才能阅读完成。
问题诊断:聚类不合理的典型表现
刚接触 CiteSpace 的研究者常遇到以下聚类问题:
- 类间重叠严重:不同颜色聚类区域大面积交叉(如图 1 左),导致主题边界模糊
- 主题过于分散:单个聚类被拆分成多个小碎片(如 Q 值 <0.3)
- 标签匹配偏差:自动生成的聚类标签与内容不符(如 LLR 算法误标)
- 关键节点丢失:高中心性论文未被纳入聚类(因 g -index 设置过高)

图注:左图为默认参数下的重叠聚类,右图为调整后的清晰分区(Q=0.4323)
算法解析:三大聚类算法对比
1. LLR 算法(对数似然率)
- 特点:适合识别领域特异性术语(如 ”blockchain” 在金融科技领域)
- 公式:$LLR = 2 \sum O_{ij} \ln\frac{O_{ij}}{E_{ij}}$
- 优势:对低频关键词敏感
2. MI 算法(互信息)
- 适用场景:跨学科研究(如生物医学工程)
- 缺陷:易受边缘节点干扰
3. TF-IDF 算法
- 最佳实践:大规模文献计量(>10 万篇)
- 注意:需先做词干提取(STEM)
参数工程:网络剪枝策略
Pathfinder 网络
- 勾选
Pathfinder时: - 保留关键路径,适合趋势分析
-
参数建议:
r=inf, q=n-1 -
最小生成树(MST):
- 得到最简连接,适合初学者
- 风险:可能丢失次要关联
实战演示:完整处理流程
数据预处理(Python)
import pandas as pd
# 读取 WOS 数据
df = pd.read_csv('savedrecs.txt', sep='\t', encoding='utf-8')
# 清洗作者字段
df['AU'] = df['AU'].str.replace(';', ';', regex=False)
# 保存为 CiteSpace 格式
df.to_csv('input.csv', index=False, columns=['TI','AB','DE','AU','PY'])
CiteSpace 宏命令配置
# 设置时间切片
Time Slicing: 2000-2022 | Years Per Slice: 2
# 关键参数
Selection Criteria: g-index(k=25)
Pruning: Pathfinder + MST
避坑指南:时间窗同步
- 突发检测窗口:需与聚类时段对齐
- 错误示例:突发检测用 5 年段,聚类用 2 年段
- 解决方案:
- 在
Burstness选项卡统一时间单位 - 勾选
Sync Time Slicing
交叉验证:VOSviewer 联动
- 导出 CiteSpace 的
network文件 - 在 VOSviewer 中:
- 设置相似度阈值 >0.5
- 对比模块化指标差异
参数调试检查清单
- [] 检查 Q 值是否 >0.3
- [] 验证 LLR 标签语义相关性
- [] 对齐突发检测与聚类时间窗
- [] 保存不同剪枝策略的结果
- [] 交叉检查中心性 TOP10 节点
通过系统性参数调整,笔者的聚类模块值从 0.28 提升至 0.41。建议初次使用者优先调试 g -index 和剪枝组合,这是改善聚类效果最直接的杠杆点。
正文完
