共计 1741 个字符,预计需要花费 5 分钟才能阅读完成。
问题背景
在使用 CiteSpace 进行文献聚类分析时,新手常会遇到聚类编号不连续的情况。具体表现为:生成的聚类图中,编号出现跳跃(如 1,3,5 缺失 2,4),或部分聚类完全消失。这种问题直接影响:

- 结果解读的连贯性(无法判断是算法过滤还是数据问题)
- 可视化效果(断裂的编号影响图表美观)
- 后续统计(如聚类数量计算可能出错)
原因分析
通过实际案例测试,发现编号断裂主要源于以下三方面:
- 数据质量问题
- 文献数据中存在大量低被引 / 零被引文献
- 关键词或摘要字段存在大量缺失值
-
数据时间跨度设置不合理(如包含过早的文献)
-
参数设置不当
- 节点类型(Node Types)选择不匹配分析目标
- 剪切(Pruning)参数过于激进(如 Pathfinder 或 MST 设置过强)
-
聚类算法(Cluster Algorithm)的敏感度阈值过高
-
软件运行机制
- CiteSpace 自动过滤成员数过少的聚类(默认 <3)
- 网络可视化时自动隐藏重叠节点
解决方案
数据预处理阶段
- 数据清洗
- 在 Web of Science 导出时勾选 ” 全记录与参考文献 ”
-
使用 Python 预处理关键词字段(示例代码):
import pandas as pd df = pd.read_csv('savedrecs.txt', sep='\t') # 填充缺失关键词 df['DE'] = df['DE'].fillna('') # 合并同义关键词 df['DE'] = df['DE'].str.replace('artificial intelligence', 'AI') -
时间切片调整
- 在 CiteSpace 的 ”Time Slicing” 中:
- 设置合理时间跨度(建议 3 - 5 年 / 片)
- 勾选 ”Per Slice” 保证每片数据量均衡
参数优化阶段
- 关键参数设置路径
- Pathfinder:建议取消勾选(首次分析时)
- Minimum Spanning Tree:建议单独使用
-
Node Strength Threshold:从 2 逐步下调测试
-
聚类算法选择
- 新手建议使用 ”LSI” 算法(稳定性较高)
- 高级用户可尝试 ”LLR”+ 手动调整 log likelihood 阈值
结果修正阶段
- 强制显示所有聚类
- 在可视化界面按 Ctrl+Shift+O
-
修改 config 文件夹中的 cluster.properties 文件:
minimum.cluster.size=1 show.small.clusters=true -
重新编号方法
- 导出 Network 文件后使用 Python 重编号(示例代码):
import networkx as nx G = nx.read_gexf('network.gexf') # 按聚类大小重新编号 clusters = sorted(nx.get_node_attributes(G, 'cluster').items(), key=lambda x: -list(x[1].values())[0]) for i, (node, _) in enumerate(clusters): G.nodes[node]['cluster'] = {'0': i+1} nx.write_gexf(G, 'network_renumbered.gexf')
避坑指南
- 高频错误 1 :直接使用原始数据
-
解决方法:务必检查 Data/network 文件夹中的 log 文件,观察被过滤的文献比例
-
高频错误 2 :参数一刀切
-
建议:先用默认参数运行,再逐步调整(记录每次参数变化)
-
高频错误 3 :忽视时区设置
- 注意:WOS 数据需在 CiteSpace 的 ”Project” 设置中选择正确时区(UTC+8)
进阶建议
- 可视化优化技巧
-
在 ”Visualization” 选项卡中:
- 调整 ”Cluster Label Size” 与 ”Node Font Size” 比例(建议 3:1)
- 使用 ”Color Blending” 突出关键聚类
-
结果验证方法
- 用 VOSviewer 交叉验证聚类结构
-
对关键聚类进行人工文献阅读验证
-
自动化脚本推荐
- 使用 CiteSpace 的 ”Macro” 功能记录操作流程
- 配合 Python 的 pyCiteSpace 库批量处理多组数据
实践心得
经过多个项目的验证,发现聚类编号问题往往不是单一因素导致。推荐采用 ” 数据清洗→参数测试→结果验证 ” 的三步法,通常 2 - 3 次迭代即可获得理想结果。特别提醒:不要追求绝对的编号连续性,某些学科领域本身存在自然聚类间隔,这种情况需要结合专业知识判断是否为真实现象。
正文完
