学术搜索 · AI 审稿 · LaTeX 协作
CiteSpace / VOSviewer 入门:数据导入报错乱码怎么解、关键词共现与聚类图怎么看?
张薇 · 首席研究员 · 发布 2026-06-25
从 WoS/CNKI 导出数据、化解中文乱码与导入报错,到读懂关键词共现、聚类与突现图——一篇可照做的文献计量可视化入门,并说清 CiteSpace 与 VOSviewer 各自该用在哪。
文献计量可视化的入门门槛,九成卡在「数据没导进去」和「图看不懂」这两步。结论先给:导出时务必用规范格式(WoS 选 Plain Text、文件名以 download 开头且为 .txt;CNKI 选 Refworks),中文乱码的根因是编码,把文件另存为 UTF-8、并在 CiteSpace 里切到 Chinese Encoding 即可解决;读图时记住三类——共现看主题构成、聚类看主题分群、突现(burst)看时间上的热度爆发。CiteSpace 强在时间演化与突现探测,VOSviewer 强在大网络的聚类与美观可视化,二者常配合使用。
一、文献计量到底在画什么
文献计量(Bibliometrics / Scientometrics)不是读单篇论文,而是把成百上千篇文献的元数据(标题、关键词、作者、机构、参考文献、年份)当作网络节点和连边,用统计与可视化把一个领域的「知识地图」画出来。你能据此回答:这个方向有哪些主题?谁是核心作者与机构?近几年的研究前沿在往哪走?哪些是绕不开的奠基文献?CiteSpace(陈超美教授开发)和 VOSviewer(莱顿大学 CWTS 团队开发)是目前中文学界最常用的两款免费工具。
二、从 WoS / CNKI 导出数据(格式是第一道坎)
两款工具都不直接连数据库,你需要先从来源库把题录导成它们认得的文本文件。不同来源的「正确导出方式」差异很大,按下面的清单照做能避开大半坑。
- Web of Science:在结果页选「导出 → 纯文本(Plain Text)」,记录内容选「全记录与引用的参考文献(Full Record and Cited References)」——少了参考文献,CiteSpace 的共被引分析就做不了。每次最多导 500 条,超过要分批导。
- WoS 文件命名:文件名必须以 download 开头、扩展名为 .txt(如 download_1-500.txt),CiteSpace 才会识别;多个文件全部放进项目的 input 文件夹。
- CNKI:勾选文献后选「导出与分析 → 导出文献」,格式选「Refworks」,导出为 .txt;这是 CiteSpace 对 CNKI 支持最稳的格式。
- CNKI 进 CiteSpace 前需经内置的「CNKI 格式转换」转成 WoS 风格;CSSCI 则可用官方 CSSCIREC 转换工具转换。
- VOSviewer 路线:它直接读 WoS、Scopus、PubMed、RIS、Crossref JSON 等格式;CNKI 数据通常先转成 RIS 或经第三方脚本/工具转换后再导入。
三、导入报错与中文乱码,怎么逐个排掉
导入阶段最常见的几类报错,绝大多数都能归到「编码」「文件名/格式」「字段缺失」三件事上。下面按现象给解法。
- 中文显示成方块/问号(乱码):根因是编码。用记事本/VS Code 打开导出的 txt,「另存为」时把编码从 ANSI 改成 UTF-8;再在 CiteSpace 的 Preferences 里把语言切到「Chinese Encoding」,重新转换即可。
- 点 Import/Export 后表格为空、读到 0 条记录:多半是 WoS 没选「全记录与引用的参考文献」,或文件名不是 download 开头、不是 .txt,或文件没放进 input 文件夹。
- 弹 Java 相关错误、软件起不来:CiteSpace 依赖 Java 运行环境,确认装了对应版本的 JDK/JRE,且版本与 CiteSpace 要求匹配。
- CNKI 中英文关键词被当成两个词:CNKI 题录里同一概念常有中英双语关键词,共词分析会把它们算成不同节点,需在分析前用别名/同义词合并(VOSviewer 用 thesaurus 文件,CiteSpace 用 alias 列表)统一。
- 字段不全导致分析受限:CSSCI 数据缺摘要字段、CNKI 数据缺参考文献字段——这会让基于摘要或共被引的分析无法进行,属数据源固有限制,需提前知晓。
四、关键词共现图怎么读
共现(co-occurrence)统计的是「两个关键词在同一篇文献里一起出现」的频次。图里每个节点是一个关键词,节点越大代表出现频次越高;两个节点之间有连线、且越粗,说明它们越常一起出现。读图先看大节点(领域的高频核心概念),再看连线密集的局部(联系紧密的主题簇)。在 CiteSpace 里还要关注一个独有指标——中介中心性(centrality):中心性高(常以紫色外圈标注、阈值通常取 0.1)的节点是连接不同主题的「枢纽」,往往是领域的转折点或交叉点,价值不亚于高频词。
五、聚类图与突现(burst)图怎么读
聚类(clustering)是在共现/共被引网络上,把联系紧密的节点自动归成若干「主题群」,每个聚类会用编号(#0、#1……号越小成员越多)和一个代表性标签命名。判断聚类质量看两个指标:模块度 Q(Modularity,>0.3 一般认为聚类结构显著)和平均轮廓值 S(Silhouette,>0.5 算合理、>0.7 高度可信)。VOSviewer 用不同颜色区分聚类,在大网络上的聚类与排版尤为清晰美观。
突现(burst detection,又称突发性探测)是 CiteSpace 的招牌功能,专门回答「时间」问题:它检测某个关键词或某篇文献在某段时间内引用/出现频次的异常激增,并标出突现的起止年份与强度。突现词列表 + Timeline(时间线)/ Timezone(时区)视图,能直观看出「哪个主题在哪几年突然变热」——这正是寻找研究前沿与新兴趋势的关键证据。一句话:共现/聚类回答「领域有什么」,突现回答「什么正在兴起」。
六、用这些图找研究热点与核心文献
- 找当前热点:看共现图里的大节点 + 近年仍在增长的聚类,二者交集就是活跃主题。
- 找新兴前沿:看突现词列表中突现起始年靠近当下、突现仍未结束的词,以及 Timeline 视图右侧新冒出的聚类。
- 找核心/奠基文献:做文献共被引(co-citation)分析,被引频次高且中心性高的节点,通常是绕不开的经典工作。
- 找研究空白:留意聚类之间「连得稀疏」的区域,或某些方法/主题尚未与主流簇产生连接,这往往是可切入的缝隙。
- 回头精读:把上面定位到的核心文献和热点关键词带回检索系统,逐篇精读验证——计量图给方向,精读给结论。
七、CiteSpace vs VOSviewer:该用哪个
两者不是替代关系,而是分工。简单说:要看时间演化和新兴前沿,用 CiteSpace;要做大规模网络的聚类、并要出版级好看的图,用 VOSviewer。很多高质量综述会两个一起用,互相印证。
| 维度 | CiteSpace | VOSviewer |
|---|---|---|
| 核心强项 | 突现探测、时间线/时区视图、共被引分析 | 大网络聚类、密度图、交互式可视化 |
| 最适合的问题 | 研究前沿、热点演化、转折性文献 | 领域全景、主题分群、合作/共现网络 |
| 独有指标/功能 | Burst 突现、中介中心性、Timeline | Thesaurus 同义词合并、Overlay/Density 视图 |
| 可视化观感 | 信息密度高,需要学习成本 | 排版清晰美观,出图即可用 |
| 运行环境 | 依赖 Java(JDK/JRE) | 依赖 Java,跨平台,操作更直观 |
| 中文数据 | 支持(需转换 + Chinese Encoding) | 原生偏英文库,中文需先转 RIS 等格式 |
| 上手难度 | 中等偏高,参数多 | 较低,向导式操作 |
八、一条可复现的最小工作流
- 明确研究问题与检索式,圈定时间范围与来源库(WoS 核心合集 / CNKI / CSSCI 等)。
- 规范导出题录:WoS 选全记录+参考文献的 Plain Text、文件名 download*.txt;CNKI 选 Refworks;必要时另存 UTF-8。
- 建好 data/input/project 三文件夹,导入并完成格式转换(CNKI/CSSCI 走转换工具)。
- 先跑关键词共现 + 聚类,设好最小出现次数与阈值,检查 Q/S 指标是否达标。
- 再跑突现探测与 Timeline,定位前沿;做共被引找核心文献。
- 把热点与核心文献带回检索/精读环节验证,形成结论;保留参数与版本号以便复现。
导入后中文还是乱码,UTF-8 也试过了怎么办?
再确认两点:一是另存 UTF-8 后是否「以 ANSI 又被某个环节覆盖」(用 VS Code 看右下角编码最稳),二是 CiteSpace 的 Preferences 是否切到了 Chinese Encoding 并重新做了格式转换。CNKI 数据还要确保导出的是 Refworks 格式而非 Note/EndNote 等其他格式。
CiteSpace 读到 0 条记录,但文件明明有数据?
最常见三个原因:WoS 导出时没选「全记录与引用的参考文献」、文件名不是以 download 开头的 .txt、或者文件没放进项目的 input 文件夹。逐一排查基本都能解决;CNKI/CSSCI 还需先经内置转换或官方转换工具处理。
VOSviewer 里同一个概念出现好几种写法,图很乱?
用 thesaurus(同义词)文件做合并:建一个两列的映射表,把 deep learning、Deep Learning、深度学习等变体统一到一个标准词,导入时加载该 thesaurus 即可。CiteSpace 对应的是 alias 别名列表。
聚类的 Q 值和 S 值多少算合格?
一般经验:模块度 Q>0.3 表示聚类结构显著,平均轮廓值 S>0.5 表示聚类合理、>0.7 表示高度可信。两者偏低时,可调整阈值、缩小时间切片或清洗同义词后重跑。这是经验阈值,具体仍要结合领域判断。
只用一款工具行不行,必须两个都用吗?
完全可以只用一款。若研究重点是趋势与前沿,CiteSpace 单独够用;若重点是领域全景与好看的网络图,VOSviewer 单独够用。两个一起用主要是为了交叉印证、让结果更稳健,并非硬性要求。
小结:文献计量入门的关键不在工具多高深,而在「干净的数据 + 看得懂的图」。把导出格式和编码这两道坎跨过去,再分清共现、聚类、突现各自回答什么问题,你就能用一张知识地图快速摸清一个陌生领域。先把高质量文献筛准、再交给 CiteSpace / VOSviewer 可视化、最后回到精读验证——这套闭环,比反复折腾参数有用得多。
作者:张薇 —— 信息科学博士,专注于学术信息检索和知识图谱研究,主持多项国家级科研项目。