共计 1349 个字符,预计需要花费 4 分钟才能阅读完成。
背景痛点:新手常踩的聚类数量设置陷阱
刚接触 CiteSpace 做文献聚类分析时,最容易陷入两个误区:

- 盲目信任默认值:软件初始设定的聚类数可能不符合实际数据特征,比如默认显示 Top 50 标签,但你的领域可能只需关注前 20 个核心聚类
- 忽略指标验证 :直接采用系统自动生成的聚类结果,没有通过模块度(Modularity/ Q 值) 和轮廓系数 (Silhouette Coefficient) 验证聚类质量
记得我第一次用 CiteSpace 时,就因为没调整参数,导致生成的图谱出现大量重叠聚类,根本没法清晰解读研究热点。
技术方案:两个关键指标的科学用法
1. 模块度 (Q 值) 计算原理
Modularity 是评估网络社区划分质量的指标,CiteSpace 中 Q 值范围在 0 - 1 之间:
- 0.3 以上说明聚类结构显著
- 0.4-0.7 为理想区间
- 低于 0.3 建议重新调整参数
计算方式是通过比较实际边密度与随机网络的期望密度,数学公式为:
Q = (1/2m)Σ[Aij - (ki*kj)/2m ]δ(ci,cj)
(看不懂公式没关系,记住看结果数值就行)
2. 轮廓系数的应用场景
Silhouette Coefficient 衡量同一聚类内文献的相似度:
- 越接近 1 说明聚类越合理
- 负数表示文献放错了聚类
- 建议结合 Q 值交叉验证
在 CiteSpace 的 Metrics 面板可以同时查看这两个指标(如下图所示):
[截图位置:聚类结果页面的指标显示区域]
操作演示:三步调整法
步骤 1:预处理网络
- 导入数据后,先设置
Pathfinder和Pruning参数 - 稀疏网络建议选
Pathfinder - 密集网络用
Pruning sliced networks - 点击
Network→Show Network生成基础图谱
[截图位置:Pathfinder 参数设置界面]
步骤 2:优化聚类数量
- 在
Clustering选项卡调整Maximum Clusters数值 - 观察 Q 值和轮廓系数的变化趋势
- 找到指标拐点对应的聚类数(如下图示例)
[截图位置:聚类数量与指标变化曲线图]
步骤 3:调整标签显示
- 菜单路径:
Network→Show Network→Clusters - 修改
Labels per cluster显示数量 - 建议初期显示 3 - 5 个标签避免重叠
[截图位置:标签数量设置对话框]
避坑指南:关键注意事项
- 高频文献干扰 :被引超高的奠基性文献会形成独立聚类,建议在
Node Types中排除这类节点 - 时间切片设置:
- 短期趋势分析用 1 年切片
- 中长期研究不超过 3 年
- 在
Time Slicing面板调整
[截图位置:时间切片设置界面]
可视化优化技巧
遇到标签重叠时,试试这些方法:
- 在
Layout→Cluster View中: - 勾选
Optimize Labels自动避让 - 手动拖动标签到合适位置
- 调整
Label Size和Font提高可读性 - 使用
Convex Hull功能突出聚类边界
[截图位置:标签优化前后的对比图]
练习数据集
CNKI 文献题录示例格式(保存为.txt 文件):
AU 作者 1; 作者 2
TI 文章标题
SO 期刊名称
PY 发表年份
AB 摘要内容
CR 参考文献 1; 参考文献 2
建议先用 10-20 篇文献练习参数调整,熟悉后再处理大数据集。刚开始可能会觉得参数太多,但掌握这几个核心设置后,你会发现 CiteSpace 的聚类分析其实很有规律——就像调相机焦距一样,找到最清晰的 ” 对焦点 ” 就能呈现完美的知识图谱。
正文完
