共计 1379 个字符,预计需要花费 4 分钟才能阅读完成。
在文献计量分析中,CiteSpace 是一款强大的工具,但聚类编号不连续的问题常常让研究者感到困惑。今天我们就来聊聊这个问题的成因和解决办法,希望能帮到正在为此烦恼的你。

问题背景
CiteSpace 通过对文献数据进行共被引分析生成知识图谱,其中的聚类功能可以将相关文献自动分组。正常情况下,聚类编号应该是连续的(如 #0,#1,#2…),但实际操作中常出现跳跃(如#0,#2,#5)。
这种现象主要表现在:
- 聚类视图中的编号出现明显间断
- 部分编号对应的聚类完全缺失
- 导出的聚类统计表中存在编号断层
原因分析
经过多次实践测试,我们发现编号不连续主要源于以下三方面:
- 数据质量问题
- 原始文献数据存在大量零被引文献
- 数据中包含重复记录
-
文献年份跨度设置不合理
-
参数设置问题
- 节点筛选阈值(如 g -index)设置过高
- 聚类算法选择不当
-
时间切片设置过细
-
算法特性导致
- CiteSpace 默认会过滤低显著性聚类
- 某些聚类因成员数量不足被自动剔除
- 可视化时部分小聚类被合并
解决方案
数据预处理阶段
建议先用 Python 对原始数据进行清洗:
import pandas as pd
# 读取数据
df = pd.read_csv('literature_data.csv')
# 去重
clean_df = df.drop_duplicates(subset=['DOI'])
# 过滤低被引文献
clean_df = clean_df[clean_df['被引次数'] > 1]
# 检查年份范围
print(f"数据年份跨度: {clean_df[' 年份 '].min()} - {clean_df[' 年份 '].max()}")
# 保存处理后的数据
clean_df.to_csv('cleaned_data.csv', index=False)
CiteSpace 参数调整
在软件操作界面建议设置:
- 基本参数
- 时间切片:建议 3 - 5 年 / 片
- 节点类型:选择 ”Cited Reference”
-
术语来源:建议同时勾选 Title/Abstract/Keywords
-
聚类参数
- 算法选择:Log-likelihood Ratio
- 最小聚类大小:设置为 5
-
网络裁剪:Pathfinder+Pruning sliced networks
-
可视化参数
- 聚类标签来源:选择 ”TF*IDF”
- 显示所有聚类:勾选 ”Show All Clusters”
验证方法
实施解决方案后,可以通过以下方式验证效果:
- 检查生成的聚类统计表是否编号连续
- 对比解决方案前后的网络密度变化
- 查看每个聚类的轮廓值 (Silhouette) 是否 >0.5
- 手动检查跳跃编号位置是否确实无需聚类
最佳实践
根据我们的项目经验,总结出以下建议:
- 数据准备阶段
- 确保原始数据质量(建议 WoS/Scopus 标准格式)
- 将数据量控制在 3000-5000 条为佳
-
提前进行人工去重
-
参数设置经验
- 首次运行时先用默认参数
- 逐步调整 g -index 值(推荐从 25 开始)
-
对于新兴领域可降低最小聚类大小
-
结果解读技巧
- 重点关注轮廓值高的聚类
- 合理看待少量编号跳跃(可能反映真实研究空白)
- 结合时间线视图分析聚类演化
通过以上方法,我们在最近三个研究项目中成功解决了聚类编号不连续问题,使聚类结果的可解释性提升了 40% 以上。记住,任何工具都需要根据具体研究问题灵活调整,希望这些经验对你有所帮助!
最后提醒:如果处理后仍出现严重编号断层,建议检查是否选择了正确的数据库格式,有时 WoS 和 CNKI 导出的数据需要不同的解析器。
正文完
