共计 1952 个字符,预计需要花费 5 分钟才能阅读完成。
文献计量分析中聚类数量的重要性
在科学知识图谱构建中,聚类数量直接影响研究前沿识别的精度。《科学计量学》2021 年的研究表明,不当的聚类数量会导致:

- 过拟合 :产生大量微小碎片化聚类(平均 <5 篇文献)
- 欠聚类 :掩盖真实存在的细分研究主题(如将‘机器学习’与‘深度学习’强行合并)
理想聚类应满足:
- 类内文献强相关性(高模块度 modularity)
- 类间边界清晰(轮廓系数 >0.5)
- 与领域专家认知一致(需人工校验)
CiteSpace 三大聚类算法对比
1. LLR(对数似然比, Log-Likelihood Ratio)
数学原理:
$$LLR(t,c) = 2 \sum_{t,c} O_{t,c} \log\left(\frac{O_{t,c}}{E_{t,c}}\right)$$
- 优势:对高频词敏感,适合主流学科
- 案例:在 COVID-19 研究中能有效区分‘疫苗开发’与‘传播模型’
2. MI(互信息, Mutual Information)
$$MI(X,Y) = \sum_{y\in Y} \sum_{x\in X} p(x,y) \log\left(\frac{p(x,y)}{p(x)p(y)}\right)$$
- 特性:捕捉非对称共现关系,适合跨学科研究
- 实测:在‘人工智能 + 医疗’领域比 LLR 多识别 17% 的交叉主题
3. TF-IDF 的局限性
- 忽略词序(‘深度学习模型’≠‘模型深度学习’)
- 长尾词权重过高(如特定化学物质名称)
- 建议:结合 n -gram 改进
数据预处理实战(Python 示例)
import pandas as pd
from sklearn.feature_extraction.text import TfidfVectorizer
# 去重与清洗
df = pd.read_csv('wos_data.csv')
df = df.drop_duplicates('DOI')
def clean_text(text):
# 自定义停用词表 + 领域术语保护
stopwords = set(['however', 'therefore'])
protected_terms = ['COVID-19', 'machine_learning']
# 处理逻辑...
return processed_text
df['clean_abstract'] = df['Abstract'].apply(clean_text)
关键步骤:
- 保护连词术语(如‘deep_learning’转为单个 token)
- 移除低信息量高频词(‘this study’,‘results show’)
- 保留数字与特殊符号(化学式、基因编号等)
聚类质量评估方法
轮廓系数(Silhouette Score)
$$s(i) = \frac{b(i) – a(i)}{\max{a(i),b(i)}}$$
Matplotlib 可视化:
from sklearn.metrics import silhouette_samples
import matplotlib.pyplot as plt
# 计算每个样本的轮廓系数
sample_silhouette_values = silhouette_samples(X, cluster_labels)
# 绘制横向条形图
plt.barh(range(len(X)), sample_silhouette_values, height=1.0)
plt.axvline(x=np.mean(sample_silhouette_values), color="red", linestyle="--")
模块度(Modularity)优化
$$Q = \frac{1}{2m} \sum_{ij} \left[A_{ij} – \frac{k_i k_j}{2m} \right] \delta(c_i,c_j)$$
- 经验值:Q>0.3 表示显著社区结构
- 与时间切片联动:早期文献较少时可放宽阈值
避坑指南
高频词干扰排除
- 动态停用词表:根据词频分布曲线,移除‘拐点’右侧高频词
- 领域词典过滤:优先保留 MeSH/ACM 分类体系中的术语
参数协同优化
- 时间切片建议:
- 爆发期(如 2020 年疫情):1 年 / 切片
- 平稳发展期:3- 5 年 / 切片
- g-index 调整:
- 初始值:g = sqrt(N)/2(N 为文献总数)
- 观测聚类数量变化曲线选择平台区
非英语文献处理
- 混合语料方案:
- 中文:结巴分词 + 自定义词典
- 日语:mecab-ipadic-NEologd
- 翻译一致性检查:确保同一术语不同语言版本归入相同聚类
开放性问题:学科交叉的判别
当发现‘材料科学’与‘生物工程’出现重叠聚类时,建议:
- 人工核查关键桥接文献(betweenness centrality 高的节点)
- 检查共被引网络的时间流向(是否呈现单向知识转移)
- 对比不同算法结果的一致性(LLR 与 MI 的差异可能揭示算法偏差)
实际研究中,我们可能需要接受一定程度的模糊性——这正是跨学科创新的温床。
正文完
