共计 1533 个字符,预计需要花费 4 分钟才能阅读完成。
背景痛点:数据导入的常见陷阱
刚开始用 CiteSpace 分析 WoS 数据时,我踩过不少坑。最典型的问题就是数据格式混乱:

- 作者字段合并:WoS 默认用分号分隔作者,但有些数据会用逗号,导致 CiteSpace 识别成单个作者
- 参考文献缺失 :下载数据时没勾选
Cited References选项,后续无法做共被引分析 - 编码问题:UTF- 8 格式的 CSV 文件在 CiteSpace 中显示乱码(尤其是中文文献)
数据预处理:Python 自动化清洗
用这个脚本处理 WoS 的download.txt,关键步骤包括:
import pandas as pd
def clean_wos_data(file_path):
try:
# 处理编码问题
df = pd.read_csv(file_path, sep='\t', encoding='utf-8-sig',
error_bad_lines=False)
# 标准化 ISSN 号(注意保留连字符)df['ISSN'] = df['ISSN'].str.replace(r'[^0-9-]', '')
# 作者字段规范化(替换不规则分隔符)df['Authors'] = df['Authors'].str.replace(',', ';')
# 机构去重(处理 "Univ Beijing; Peking Univ" 这类重复)df['Affiliations'] = df['Affiliations'].apply(lambda x: ';'.join(sorted(set(x.split(';'))))
if pd.notnull(x) else x)
df.to_csv('cleaned_data.csv', index=False, encoding='utf-8-sig')
except Exception as e:
print(f"处理失败: {str(e)}")
核心参数详解
1. g-index 调节
这个参数控制网络规模:
– 值越小网络越稀疏(建议初次尝试设为 25)
– 文献量 >500 时可提高到 50
2. 算法选择
- LLR(对数似然比):更适合发现独特聚类标签
- MI(互信息):对高频词更敏感
3. Pathfinder 剪裁
勾选后会:
– 移除冗余连接(改善蜘蛛网图)
– 但可能丢失弱关联(需配合 Pruning 一起使用)
可视化优化技巧
时区图 vs 聚类图
- 时区图(Timezone View):看研究主题演变
- 聚类视图(Cluster View):找当前热点关联
调整技巧:
- 节点大小映射
Node Size→Citation Count - 颜色选择
Color→Cluster更易区分 - 标签显示数在
Labels→Items per slice设置
三大避坑案例
案例 1:节点过多
现象:图谱像蜘蛛网
解决:
1. 调低 g -index
2. 启用 Pathfinder 剪裁
3. 增加 Top N% per slice
案例 2:聚类无意义
现象:聚类标签都是通用词
解决:
1. 改用 LLR 算法
2. 检查数据是否混入非学术文献
案例 3:关键文献缺失
现象:重要论文没出现在网络
解决:
1. 确认原始数据包含参考文献
2. 检查 CiteSpace 的 Node Types 设置
进阶验证:VOSviewer 交叉检验
把 CiteSpace 生成的 network 文件导入 VOSviewer:
- 比较模块化 Q 值(>0.4 说明结构显著)
- 查看平均轮廓值(S>0.5 聚类合理)
- 手动合并相似聚类(颜色相近的节点)
测试数据集
我整理了一个清洗好的样例数据:sample_data.zip 包含:
– 200 篇 AI 领域的 WoS 记录
– 预处理后的 CSV 文件
– CiteSpace 项目配置文件
写在最后
第一次跑出清晰可解释的聚类图时特别有成就感。建议先从少量数据(<300 篇)开始练习,重点观察参数调整对图谱的影响规律。遇到问题可以多对比 VOSviewer 的结果,两个工具配合使用效果更好。
正文完
