共计 1565 个字符,预计需要花费 4 分钟才能阅读完成。
背景介绍
CiteSpace 作为文献计量分析的主流工具,其聚类功能能直观展现领域知识结构。但在分析 Web of Science 或 CNKI 数据时,常遇到聚类标签缺失(如仅显示 CLU1/ 2 编号)或标签过少的问题。这不仅影响结果解读,更可能导致重要研究前沿被遗漏。

问题诊断
1. 算法机制限制
CiteSpace 默认使用 LLR 算法提取标签,当:
– 聚类内文献关键词重复率低
– 存在大量宽泛术语(如 ”study””analysis”)
– 聚类边缘文献占比过高时
算法会判定无显著代表性词汇
2. 参数设置问题
- Node Types选择不当(如误选 Institution 而非 Keyword)
- g-index值过高(默认 k =25 可能过滤有效标签)
- Cosine 算法 的相似度阈值过高(>0.7 时标签锐减)
3. 数据质量缺陷
- 原始数据包含大量停用词
- 关键词字段存在格式混乱(如中英文混杂)
- 文献样本量不足(<500 篇时聚类稳定性差)
技术解决方案
参数优化组合
- 基础参数调整
- Time Slicing:缩短时间切片(如 1 年→6 个月)增加时间维度标签
- Selection Criteria:Top N=50→Top N% 调整为 10%
-
Node Types:优先测试 Keyword+Term 组合
-
高级参数配置
# 在 config 界面修改 Pathfinder → Pruning=Minimum Spanning Tree Cluster → Label=Both LLR+MI
数据预处理技巧
- 关键词清洗
- 使用 Python 预处理 WOS 数据:
import pandas as pd df['DE'] = df['DE'].str.replace(r'(?i)\bstudy\b|\banalysis\b', '') -
合并近义词(如 ”blockchain” 和 ”DLT”)
-
文本增强
通过 TI/AB 字段补充 DE 字段缺失的关键词
可视化调整
- 修改
View → Labels: - 勾选 ”Show All Cluster Labels”
- 调整 Font Size=10→14
- 使用
Cluster Explorer二次筛选: - 设置 Min Cluster Size=3→5
- 勾选 ”Hide Insignificant Labels”
实战演示
以 COVID-19 文献分析为例:
- 数据准备
- 下载 WOS 核心合集数据(2020-2022)
-
导出纯文本格式,注意勾选 AB/TI/DE 字段
-
参数设置
Time Slicing: 12 slices (1/year) Term Source: Title+Abstract+Keywords Node Types: Noun Phrases Pruning: Pathfinder+Pruning sliced networks -
结果优化
- 发现初始仅 8 个标签
- 调整 Selection Criteria 为 Top 30% 后增至 14 个
- 启用 TI/AB 字段补充后达 21 个有效标签
避坑指南
- 错误 1 :直接修改原始 Excel 数据
-
修正:应通过 CiteSpace 的 Data→Filter 功能处理
-
错误 2 :忽视时区设置
-
修正:需保持 Time Zone=UTC+8(中国数据)
-
错误 3 :过度依赖自动聚类
- 修正:建议手动检查 Silhouette 值 <0.5 的聚类
进阶建议
- 结果验证
- 将 CiteSpace 的 network 文件导入 VOSviewer
-
对比两种工具的聚类一致性
-
混合方法
- 用 Python 的 LDA 模型补充主题标签
from sklearn.decomposition import LatentDirichletAllocation lda = LatentDirichletAllocation(n_components=10)
参考文献
- Chen, C. (2017). Science Mapping: A Systematic Review. Springer
- 李杰 (2020). CiteSpace 中文指南. 首都经济贸易大学出版社
欢迎在评论区分享您遇到的标签优化案例,我们可以共同探讨更精细的解决方案。
正文完
