CiteSpace实战:如何从CNKI数据中绘制精准的关键词聚类图

1次阅读
没有评论

共计 1496 个字符,预计需要花费 4 分钟才能阅读完成。

image.webp

背景痛点:CNKI 数据预处理的门槛

很多同学第一次用 CiteSpace 分析 CNKI 文献时,常会遇到数据导入失败的问题。这是因为 CNKI 导出的 Refworks 格式数据包含大量中文特殊字符(如作者单位里的括号、破折号),而 CiteSpace 默认处理 UTF- 8 编码时容易出错。更麻烦的是,CNKI 的文献类型标识(如[J]、[M])会混在标题里,导致后续关键词提取不准确。

CiteSpace 实战:如何从 CNKI 数据中绘制精准的关键词聚类图

工具对比:为什么选择 CiteSpace

  • VOSviewer:虽然支持中文,但需要手动构建共现矩阵,对新手不够友好
  • Bibliometrix:擅长宏观统计,但聚类可视化功能较弱
  • CiteSpace 优势
  • 自动识别中文关键词(需开启 Term Source 选项)
  • 提供模块度(Q 值)和轮廓值(S 值)量化聚类效果
  • 支持时间切片观察演化趋势

核心操作流程

数据清洗:从 CNKI 到 CiteSpace

  1. 在 CNKI 高级检索结果页,勾选目标文献后选择 导出 /Refworks格式
  2. 用记事本打开下载的.txt 文件,执行三次替换:
  3. [J][M] 等文献类型标记替换为空
  4. %A(作者行前缀)替换为AU(CiteSpace 标准格式)
  5. 删除所有%8(页码行)和%@(ISSN 号)行
  6. 另存为 UTF- 8 编码的.txt 文件

[图示:CNKI 数据清洗前后对比]

参数配置黄金法则

Project 界面设置:

  • Time Slicing
  • 建议按 3 - 5 年分段(如 2020-2024 设 2 个切片)
  • 时间跨度超过 10 年时增加切片数
  • Selection Criteria
  • 中文文献建议 g -index=25(比默认值低)
  • 勾选 Pruning: Pathfinder 减少杂乱连线

[图示:参数设置面板]

可视化调优技巧

Visualization 界面:

  1. 点击 Node Size 调整显示阈值(通常设为 10)
  2. Labels 选项卡中:
  3. 勾选Show Cluster Labels
  4. 设置 Font Size=10 避免重叠
  5. 通过 Cluster Explorer 查看具体关键词组成

配置文件关键代码

# data/project.config 核心参数
pathfinder.pruning.mode = 2  # 1= 无修剪 2=Pathfinder 算法
gindex = 25  # 控制节点数量,值越小筛选越严格
term.source = Title,Abstract,Author Keywords  # 中文关键词来源
word.frequency.threshold = 2  # 出现 2 次以上才计入

避坑实战指南

解决中文乱码

  1. 编码转换法:用 Notepad++ 将文件转为 UTF-8-BOM 编码
  2. 注册表修改法 :Windows 用户可调整HKEY_CURRENT_USER\Software\JavaSoft 字体设置
  3. 字体替换法:在 CiteSpace 安装目录替换为微软雅黑字体

聚类质量判断

  • Q 值:0.3-0.8 为有效聚类(大于 0.7 说明分类过细)
  • S 值:平均轮廓值 >0.5 表明聚类内部一致性高

过滤无意义词

Node Types 选择 Keyword 后,右键删除:
– 高频通用词(如 ” 研究 ”、” 分析 ”)
– 检索词本身(如 ” 数字化转型 ”)

进阶:突现词联动分析

  1. Burstness 选项卡检测突现词(Burst Terms)
  2. 将突现词列表导出为.txt
  3. Overlay 功能叠加到聚类图中,观察热点变迁

自测任务

尝试以下操作并观察变化:
1. 将 gamma 参数从 0.3 调到 0.7(控制聚类紧凑度)
2. 切换 Pruning 模式为 MST 最小生成树
3. 调整 Years Per Slice 从 1 年到 5 年

通过这样的参数对比,你能更直观理解每个设置对最终可视化效果的影响。刚开始可能要多试几次才能找到最合适的参数组合,这是完全正常的。记得每次调整后保存不同的项目文件,方便回溯比较。

正文完
 0
评论(没有评论)