正在准备独立研究工作区
系统会自动建立草稿项目,不需要先填写项目名称。
研究流程
导入语料后运行 BERTopic 主题建模;系统保留清洗结果、参数、主题、文本归属、离群文本和图表。运行失败时显示真实原因和调参建议,不自动改写文本、不生成伪结果。
标准输出路径
主题输出规则
用户侧统一显示“T01 · 可读主题名”。核心术语、原始 c-TF-IDF 词、代表文本分层保留。不会把 Topic 1、主题 1 或“待人工命名主题”直接展示给用户。
标准输出
主题总表、文本与主题归属、离群文本、预处理与术语表、方法与复现记录,以及主题距离、关键词、热力图、层级图、文本分布等图表。
数据与预处理
导入 TXT、Markdown、CSV、XLSX、DOCX、PDF。表格资料建议填写文本列和时间列;时间列用于趋势与桑基图,未选择时间列时相关图表会保持禁用。
导入资料
支持 TXT、Markdown、CSV、XLSX、DOCX、PDF。表格文件可指定正文列;普通 TXT 不需要填写文本列。
已导入资料
研究成果会按标准 Corpus View 导入,不再分析运行JSON字段。BERTopic 建模
选择语料后运行 BERTopic。系统通过平台语义向量服务生成向量,并按真实文本和参数建模;运行异常时仅向普通用户提供可操作的处理建议,具体服务端技术详情仅在管理后台保留。
实验版本
每次运行独立保存。建模后输出
完成后前往“主题结果”查看主题总表、文本归属、离群文本、代表文本和原始词审计;如果运行失败,系统会给出可操作的错误说明与调参建议;服务端技术详情仅在管理后台保留,不会生成伪结果。
主题结果
主题、文本归属、离群文本和术语分开呈现。主题编号仅用于定位,显示时始终与可读主题名一起出现。
图表解读
这里把文本分析结果转成图表:先看主题规模判断主要议题,再看关键词权重解释主题含义;距离图、热力图和层级图用于观察主题之间是否接近;文本分布图用于检查聚类是否清楚。图表只在具备真实数据条件时开放。
导出与复现
优先输出论文级 XLSX 和可交互 HTML 图表。CSV、Markdown 与复现记录也保留;API Key 不会写入数据库或任何导出文件。