共计 1496 个字符,预计需要花费 4 分钟才能阅读完成。
背景痛点:CNKI 数据预处理的门槛
很多同学第一次用 CiteSpace 分析 CNKI 文献时,常会遇到数据导入失败的问题。这是因为 CNKI 导出的 Refworks 格式数据包含大量中文特殊字符(如作者单位里的括号、破折号),而 CiteSpace 默认处理 UTF- 8 编码时容易出错。更麻烦的是,CNKI 的文献类型标识(如[J]、[M])会混在标题里,导致后续关键词提取不准确。

工具对比:为什么选择 CiteSpace
- VOSviewer:虽然支持中文,但需要手动构建共现矩阵,对新手不够友好
- Bibliometrix:擅长宏观统计,但聚类可视化功能较弱
- CiteSpace 优势:
- 自动识别中文关键词(需开启 Term Source 选项)
- 提供模块度(Q 值)和轮廓值(S 值)量化聚类效果
- 支持时间切片观察演化趋势
核心操作流程
数据清洗:从 CNKI 到 CiteSpace
- 在 CNKI 高级检索结果页,勾选目标文献后选择
导出 /Refworks格式 - 用记事本打开下载的.txt 文件,执行三次替换:
- 将
[J]、[M]等文献类型标记替换为空 - 将
%A(作者行前缀)替换为AU(CiteSpace 标准格式) - 删除所有
%8(页码行)和%@(ISSN 号)行 - 另存为 UTF- 8 编码的.txt 文件
[图示:CNKI 数据清洗前后对比]
参数配置黄金法则
在 Project 界面设置:
- Time Slicing:
- 建议按 3 - 5 年分段(如 2020-2024 设 2 个切片)
- 时间跨度超过 10 年时增加切片数
- Selection Criteria:
- 中文文献建议 g -index=25(比默认值低)
- 勾选
Pruning: Pathfinder减少杂乱连线
[图示:参数设置面板]
可视化调优技巧
在 Visualization 界面:
- 点击
Node Size调整显示阈值(通常设为 10) - 在
Labels选项卡中: - 勾选
Show Cluster Labels - 设置
Font Size=10避免重叠 - 通过
Cluster Explorer查看具体关键词组成
配置文件关键代码
# data/project.config 核心参数
pathfinder.pruning.mode = 2 # 1= 无修剪 2=Pathfinder 算法
gindex = 25 # 控制节点数量,值越小筛选越严格
term.source = Title,Abstract,Author Keywords # 中文关键词来源
word.frequency.threshold = 2 # 出现 2 次以上才计入
避坑实战指南
解决中文乱码
- 编码转换法:用 Notepad++ 将文件转为 UTF-8-BOM 编码
- 注册表修改法 :Windows 用户可调整
HKEY_CURRENT_USER\Software\JavaSoft字体设置 - 字体替换法:在 CiteSpace 安装目录替换为微软雅黑字体
聚类质量判断
- Q 值:0.3-0.8 为有效聚类(大于 0.7 说明分类过细)
- S 值:平均轮廓值 >0.5 表明聚类内部一致性高
过滤无意义词
在 Node Types 选择 Keyword 后,右键删除:
– 高频通用词(如 ” 研究 ”、” 分析 ”)
– 检索词本身(如 ” 数字化转型 ”)
进阶:突现词联动分析
- 在
Burstness选项卡检测突现词(Burst Terms) - 将突现词列表导出为.txt
- 用
Overlay功能叠加到聚类图中,观察热点变迁
自测任务
尝试以下操作并观察变化:
1. 将 gamma 参数从 0.3 调到 0.7(控制聚类紧凑度)
2. 切换 Pruning 模式为 MST 最小生成树
3. 调整 Years Per Slice 从 1 年到 5 年
通过这样的参数对比,你能更直观理解每个设置对最终可视化效果的影响。刚开始可能要多试几次才能找到最合适的参数组合,这是完全正常的。记得每次调整后保存不同的项目文件,方便回溯比较。
正文完
