文档字数统计工具用于批量读取常见文档并统计字数,适合整理稿件、汇总多份资料或核对不同文件的文字规模。页面提供文件选择、文本粘贴、统计口径设置、处理进度、结果详情和数据导出等功能,所有数据均在浏览器中处理。
主要功能
- 批量添加文档:可批量选择或拖拽 TXT、Word、PDF、PPT、Excel 等文件,也可直接粘贴文本。
- 多口径字数统计:主字数可按中文汉字、非空白字符、全部字符,或中文汉字加英文单词计算。
- 多维度结果查看:结果页可显示主字数、汉字、英文单词、数字、标点、行数和段落等数据。
- 批量处理参数:可设置并行处理数量、单文件建议上限、详情预览字符数和历史记录条数。
- 结果内容导出:页面提供逐文件 TXT 报告、CSV 汇总表、JSON 数据和提取文本等选项。
使用前准备
- 页面支持 TXT、MD、CSV、HTML、RTF、DOCX、PDF、PPTX、XLSX、XLS、ODT、EPUB、SRT 等格式。
- 旧版 DOC 格式暂不支持,页面建议先转换为 DOCX 后再统计。
- 扫描版 PDF 主要由图片组成时,需要先进行 OCR 识别,工具统计的是 PDF 中可提取的文本。
- 批量添加时界面只展示前 20 个文件,但已选择的文件都会参与处理。
操作步骤
1. 选择输入方式并添加内容
在“1 选择内容”页先选择“文档文件”“粘贴文本”或“示例数据”。使用自己的文件时,点击“文档文件”,再点击页面中的“选择文件”,也可以把文件拖入添加区域。添加后检查待统计内容是否正确,然后进入“统计设置”。
2. 配置统计口径和处理参数
点击“2 统计设置”,先选择主字数口径与标点统计方式,再设置并行处理数量、单文件建议上限、详情预览字符数和历史记录条数。随后勾选需要保留的结果内容;如需下次继续使用当前配置,可点击“保存设置”,再进入“开始处理”。
3. 确认检查并开始统计
进入“3 开始处理”后,先查看“处理前检查”提示。文件或文本与统计设置都准备好后,“开始统计”按钮才会进入可用状态;点击该按钮后,页面会显示处理进度,并在完成后自动进入结果页。
4. 查看统计结果和详情
处理完成后打开第 4 个结果页。页面说明结果表可显示各文件的统计数据,点击表格行可查看文本预览和单文件报告。下图保留的是未运行工具时的真实界面,因此只标出结果出现的位置,不展示虚构数据。
主要参数说明
| 参数 | 作用 | 页面选项与建议 |
|---|---|---|
| 主字数口径 | 决定结果中的主要字数值 | 可选中文汉字数、非空白字符数、全部字符数、中文汉字加英文单词;按实际统计要求选择。 |
| 标点统计 | 决定标点的单独统计范围 | 可选中英文标点、中文标点或不单独统计。 |
| 并行处理数量 | 控制同时处理的文件数 | 页面提供 1、3、5、8 个文件选项;设备资源有限时可选择较低数量。 |
| 单文件建议上限 | 设置单个文件的建议大小上限 | 页面默认显示 50 MB,可根据文件情况调整。 |
| 详情预览字符数 | 控制单文件详情中的文本预览长度 | 可选 500、1000、2000、5000 字符。 |
| 历史记录条数 | 控制保存的统计摘要数量 | 可选 5、10、20 条;页面注明只保存统计摘要,不保存文档正文。 |
| 结果内容 | 选择需要保留的报告或数据 | 可选逐文件 TXT 报告、CSV 汇总表、JSON 数据和提取文本。 |
结果查看与保存
页面说明,处理完成后会自动进入结果页。结果表可查看文件名、主字数、汉字、英文单词、数字、标点、行数和段落等数据;点击表格行可打开文本预览和单文件报告。需要继续筛选或排序时,可使用页面提供的 CSV 汇总表导出功能;其他结果内容应以“统计设置”中实际勾选的选项为准。
常见问题与建议
1. 支持哪些文档格式?
支持 TXT、MD、CSV、HTML、RTF、DOCX、PDF、PPTX、XLSX、XLS、ODT、EPUB、SRT 等常见格式。旧版 DOC 文件需要先转换为 DOCX。
2. 汉字数按什么规则统计?
页面说明汉字数按 Unicode 汉字范围识别,包含常用汉字、扩展汉字及繁体字,不把英文、数字和标点计入汉字数。
3. PDF 统计结果为什么可能偏少?
工具提取的是 PDF 中可复制的文本。扫描版 PDF 主要由图片组成,通常需要先进行 OCR 识别。
4. TXT 文件出现乱码怎么办?
页面说明工具会自动检测 UTF-8、GBK、GB18030、Big5 等常见编码。如果内容仍异常,可先把文本转换为 UTF-8。
5. 文件会上传到服务器吗?
不会。页面明确说明文档读取、文本提取、字数统计和结果导出都在当前设备中完成。