共计 894 个字符,预计需要花费 3 分钟才能阅读完成。
1. CiteSpace 聚类分析基本原理
CiteSpace 是一款用于文献计量和科学知识图谱绘制的工具,它的关键词聚类功能可以帮助我们快速发现研究领域的热点主题和趋势。聚类分析的基本逻辑是:

- 通过算法(如 LLR、TF-IDF)对文献关键词进行分组
- 同一组内的关键词具有较高的语义相似性
- 不同组之间则体现研究主题的差异性
2. 聚类表格各列数据详解
打开 CiteSpace 生成的聚类报表(通常命名为 cluster_*.xls),你会看到包含以下关键列的表格:
| 列名 | 说明 | 解读要点 |
|---|---|---|
| Cluster ID | 聚类编号 | 数字越小表示聚类规模越大 |
| Size | 聚类大小 | 包含的关键词 / 文献数量 |
| Silhouette | 轮廓值 | 0- 1 之间,>0.5 说明聚类质量较好 |
| Label (LLR) | 聚类标签 | 最具有代表性的短语 |
| Mean Year | 平均年份 | 反映该主题的活跃时期 |
3. 识别重要聚类的 4 个维度
- 看规模 :Size 值越大,说明该主题研究文献越多
- 看质量 :Silhouette>0.7 的聚类可靠性较高
- 看新颖性 :Mean Year 较近的可能是新兴热点
- 看标签 :LLR 标签能直接反映研究主题
4. 实际案例分步解读
以某篇 COVID-19 研究文献的聚类表格为例:
- 首先找到 Size 最大的聚类 #0(Size=42)
- 确认其 Silhouette=0.812(质量优秀)
- 查看标签为 ”vaccine development”(疫苗开发)
- 结合 Mean Year(2021) 判断是疫情中期热点
- 最后检查该聚类包含的关键词列表
5. 新手常见误区
- 误区 1:只关注大聚类,忽略小但重要的新兴主题
- 误区 2:过度依赖自动标签,不人工核查关键词
- 误区 3:忽视年份信息导致趋势判断错误
- 误区 4:单独看表格不结合可视化图谱
6. 进阶分析技巧
建议采用 ” 表格 + 图谱 ” 双视图分析:
- 在表格中发现重要聚类编号
- 在可视化图谱中找到对应颜色的聚类
- 观察该聚类在知识网络中的中心度
- 分析与其他聚类的连接关系
实践建议
现在就可以用你自己的文献数据尝试:
1. 导出聚类表格并标记重点聚类
2. 对照 timeline 视图验证时间趋势
3. 记录 3 个最意外的发现
思考题:
– 为什么有些高质量聚类规模却很小?
– 如何利用聚类结果指导文献综述写作?
– 当标签与预期不符时应该检查什么?
正文完
