CiteSpace聚类图制作全指南:从数据预处理到可视化优化

1次阅读
没有评论

共计 1079 个字符,预计需要花费 3 分钟才能阅读完成。

image.webp

背景介绍:为什么需要 CiteSpace 聚类图?

CiteSpace 作为文献计量分析的经典工具,能通过聚类图直观展示学科知识结构。聚类图的价值在于:

CiteSpace 聚类图制作全指南:从数据预处理到可视化优化

  • 揭示研究领域的知识基础与前沿热点
  • 识别关键文献和学术共同体
  • 追踪学科演进路径和发展趋势

数据准备:WoS/CNKI 数据导出规范

数据导出步骤

  1. 在 Web of Science 高级检索界面设置检索式
  2. 勾选目标文献后选择『导出』→『纯文本文件』
  3. 记录内容选择『全记录与引用的参考文献』
  4. 文件格式务必选择『制表符分隔(Win)』

常见数据问题处理

使用 Python 清洗 WoS 数据的代码示例:

import pandas as pd

def clean_wos_data(filepath):
    # 处理 UTF- 8 编码问题
    df = pd.read_csv(filepath, sep='\t', encoding='utf-8', error_bad_lines=False)

    # 删除空作者记录
    df = df[df['AU'].notna()]

    # 统一年份格式
    df['PY'] = pd.to_numeric(df['PY'], errors='coerce')

    return df

参数配置详解

关键参数设置策略

  1. 时间切片
  2. 建议按 3 - 5 年划分时间段
  3. 早期数据量少时可适当延长切片

  4. 节点类型

  5. 作者合作网络选『Author』
  6. 机构合作选『Institution』
  7. 关键词共现选『Term』

  8. 修剪算法

  9. Pathfinder:保留关键连接
  10. MST:生成最小生成树
  11. 初学者建议先用默认设置

可视化优化技巧

布局调整

  • 节点大小:反映文献中心性
  • 标签阈值:一般设为 30-50
  • 颜色映射:使用色盲友好配色

解决标签重叠

  1. 调整『Label Font Size』
  2. 启用『Hide Small Labels』
  3. 手动拖动重叠标签

结果解读方法论

聚类标签生成原理

  • LLR 算法提取特征词
  • TF-IDF 加权计算
  • 可自定义标签来源(标题 / 摘要 / 关键词)

关键指标解读

  • Modularity Q > 0.3 表示聚类结构显著
  • Mean Silhouette > 0.5 说明聚类合理

常见问题解决方案

问题现象 解决方法
空聚类 调低 g -index 值
节点过密 增加 Pathfinder 参数
标签缺失 检查 Term Source 设置

进阶应用组合

  1. 时区图
  2. 显示研究主题随时间演变
  3. 需设置『Timezone』视图

  4. 突现词检测

  5. 识别突然增长的研究热点
  6. 配合 Burstness 指标分析

实践任务

  1. 尝试比较 Pathfinder 与 MST 算法的可视化差异
  2. 用同一数据集生成作者合作与机构合作两种网络
  3. 调整 Q 值观察聚类数量变化规律

通过本指南的系统实践,相信你能制作出兼具学术价值与视觉表现力的聚类图。建议初次使用时保存不同参数配置的结果,逐步积累参数敏感度的经验。

正文完
 0
评论(没有评论)