共计 1410 个字符,预计需要花费 4 分钟才能阅读完成。
背景介绍:为什么选择 CiteSpace?
CiteSpace 作为文献计量学的经典工具,其核心价值在于通过算法自动识别学科领域的研究热点与演进趋势。与传统手工分析相比,它具备三大独特优势:
- 动态网络分析 :支持时间切片功能,能直观展示研究主题的演化路径
- 智能聚类 :结合 TF-IDF 算法自动提取标签,避免人工归纳的主观性
- 爆发检测 :通过突变词分析快速锁定前沿研究方向
数据准备:从原始数据到可分析格式
Web of Science 数据导出要点
- 在 WoS 高级检索界面限定目标文献时间范围(建议 5 -10 年)
- 勾选 ” 标题、摘要、作者关键词 ” 等必选字段
- 导出格式选择 ” 纯文本 ”,记录内容选 ” 全记录与引用的参考文献 ”
CNKI 数据特殊处理
- 使用知网导出器的 NoteFirst 格式转换功能
- 需手动补全英文标题字段(中文文献需翻译)
- 注意检查作者机构名称的统一性(如 ” 北京大学 ”vs”Peking Univ”)
核心参数配置指南
时间切片设置
- 基础规则:单个切片跨度建议 1 - 2 年
- 示例配置(2010-2020 年研究):
Years per slice: 1 # Slices: 11
节点类型选择
- 关键词分析选择 ”Term”
- 机构合作网络选择 ”Institution”
- 注意勾选 ”Keyword Plus” 增强覆盖率
修剪算法对比
| 算法类型 | 适用场景 | 典型参数 |
|---|---|---|
| Pathfinder | 突出核心结构 | LBY=0.3 |
| MST | 简化网络复杂度 | – |
| Pruning sliced networks | 时序网络分析 | e=2.0 |
可视化优化技巧
聚类标签调整
- 在控制面板调整 ”Label Size Threshold”(建议 15-20)
- 使用 ”Modify Labels” 功能手动合并相似标签
- 通过 ”Cluster Explorer” 检查 TF-IDF 权重值
时区图美化
- 调整 ”Node Size Scaling” 突出高中心性节点
- 使用 ”Layout->Timeline” 模式展示演进路径
- 导出时选择 SVG 格式便于后期编辑
实战案例演示
以 ” 人工智能医疗 ” 领域为例:
- 导入 2015-2022 年 WoS 数据(500 篇文献)
- 参数设置:
Node types: Keyword Selection criteria: g-index=25 Pruning: Pathfinder + MST - 生成的关键词共现网络:

- 突变词检测结果:
- 2017 年爆发:deep learning
- 2020 年爆发:COVID-19
常见问题解决方案
内存溢出错误
- 解决方案:
- 修改 citospace.vmoptions 文件增大内存分配
- 分时段处理大数据集(如按 5 年分段运行)
聚类结果碎片化
- 检查步骤:
- 确认原始数据关键词清洗是否充分
- 尝试调整 LLR 算法权重
- 适当放宽 Selection Criteria 阈值
进阶交叉验证方法
与 VOSviewer 结果比对
- 导出 network 文件到 VOSviewer
- 重点对比:
- 核心关键词重合度
- 聚类边界一致性
Pajek 网络分析补充
- 用 Pajek 计算:
- 网络密度指标
- 核心 - 边缘结构分析
学术伦理提醒
- 数据来源必须明确标注(如 WoS 数据集编号)
- 网络图谱需注明参数设置
- 避免选择性展示有利聚类结果
延伸资源
- 官方教程:https://citespace.podia.com
- 示例数据集:https://pan.baidu.com/s/example
- 交流 QQ 群:123456789(验证:CiteSpace)
实际操作中发现,Pathfinder 算法在处理跨学科文献时效果尤其突出,但需要特别注意 LBY 参数的微调。建议首次分析时采用默认值,后续根据网络密度逐步优化。
正文完

