汉字密度分析工具

测算日语文本中汉字、平假名、片假名、罗马字的比例,用客观数据判断阅读难度与目标读者层。

100% 本地运行 · 无需上传
跳转常见问题使用方法常见问题

汉字密度分析工具

测算日语文本中汉字、平假名、片假名、罗马字的比例,用客观数据判断阅读难度与目标读者层。

在上方粘贴日语文本,即可查看汉字/假名/罗马字的构成比例。

常见问题

Q

感觉我写的 JLPT 阅读材料太正式了,怎么在学生抱怨之前先自查?

A

把文章放进这个分析工具。如果目标读者是 N3 学生,但汉字密度落在学术/正式区间(超过 40%),这就是一个客观信号,说明需要改写。把汉字熟语换成假名混写或更简单的说法,一直改到密度落在 28%〜35% 区间再重新测一次。

Q

中译日的稿子读起来很生硬,是不是汉字比例的问题?

A

从中文翻译过去时,很容易因为「反正汉字也看得懂」而把大量复合词原样保留成汉字,这是中文母语译者最容易踩的坑。如果轻松语境下的汉字密度超过 45%,通常就是该把复合词拆成假名混写形式的信号(比如 即時→すぐに)。先用这个工具定一个目标区间,再动手修改文本。

Q

明明很认真写的日语博客,为什么读起来还是显得幼稚?

A

如果主题是商务、科技、金融这类成年读者期待正式文体的内容,而汉字密度低于 20%,无论词汇选得多讲究,读起来都会偏儿童向。可以把部分假名表达适当换回汉字,把密度提升到 25%〜32% 的休闲博客区间试试看。

Q

怎么从一篇长的日语文章里提取出不重复的汉字列表?

A

粘贴文章后,从不重复汉字面板复制去重后的列表即可。列表按 Unicode 码位排序,可以直接导入 Anki,或者送进 JLPT 等级检测工具做进一步的难度分析。

Q

能不能客观比较两位作者,或者两种体裁之间的汉字密度差异?

A

可以。分别粘贴两边有代表性的段落(建议各 2000 字以上,平均值才稳定),比较汉字密度所在的区间。相差超过 5 个百分点,通常对应着能被读者察觉到的文体或体裁差异;差距小于这个幅度,基本属于作者之间的正常波动范围。

工作流程

汉字密度分析工具 是什么?

「这段日语怎么读起来这么生硬」「这段又显得太幼稚」——编辑和写作者调整文体时,凭的往往只是直觉,而这种直觉背后的真正变量,很大程度上就是汉字密度。同样的内容,多用假名写开会显得轻快,多用汉字收紧则显得正式、书面化。问题是大多数人只是凭感觉调整,从来没有一个客观数字告诉自己「现在到底是多少」。

本工具会逐字符判断输入文本属于哪种文字系统:汉字(CJK 统一表意文字及扩展区)、平假名、片假名(含半角片假名)、罗马字(全角/半角)、数字、标点、空白,以及其他符号。汉字密度是相对于「除去空白后的可见字符数」计算的,所以无论原文的换行方式或空格习惯如何,这个百分比都能保持稳定、可比较。

这个工具对中国读者尤其有用:中文母语者写日语或做中译日翻译时,因为汉字本身「看得懂」,很容易不自觉地保留过多汉字词,写出来的日语在日本人看来会显得生硬、翻译腔很重——而这恰恰是可以用一个数字量化出来的问题。

如何使用 汉字密度分析工具

1. 把要分析的日语文本粘贴到输入框。

2. 各文字类型的统计、汉字密度进度条、不重复汉字列表会立即刷新。

3. 把汉字密度对照参考区间:低于 20% 偏儿童/入门向,20%〜30% 偏轻松随笔,30%〜40% 接近新闻/商务文体,40%〜50% 偏学术/正式,50% 以上偏法律/专业文档。

4. 复制不重复汉字列表用于背单词,或者用来检查是否覆盖了目标 JLPT 等级的汉字。

示例

示例段落(40个可见字符):
• 汉字 12字(30.0%)— 接近新闻/商务文体
• 平假名 18字(45.0%)
• 片假名 6字(15.0%)
• 罗马字 0字(0.0%)
• 标点 4字(10.0%)

应用场景

1. JLPT 教材编写者检查 N3 阅读文章的汉字密度是否超过 30%。

2. 编辑把文体调整到接近 Yahoo!新闻或博客的语感(28%〜34%),避免写得过于像教科书。

3. 译者检查中译日的稿件是否残留了过多汉字词,读起来偏生硬。

4. 研究者在选择合适的分词工具之前,先了解语料库的文字类型构成。

常见问题

空白字符会怎样影响密度百分比?

空白会被单独统计,但不计入密度计算的分母(可见字符数)。所以无论原文换行习惯如何,或者用了多少全角空格( ),汉字密度的数值都能保持稳定,方便前后对比。

为什么把 30%〜40% 定义为「新闻/商务」区间?

对朝日新闻、读卖新闻等主流日本报纸以及企业文书的实证调查显示,汉字密度大多落在 30%〜37% 之间。JLPT N3 阅读题通常在 28%〜32% 左右,轻小说多数在 25%〜32%。这些区间只是用于横向比较的参考,不是绝对标准。

不重复汉字列表能用来检查 JLPT 等级覆盖情况吗?

可以。把列表复制粘贴进 JLPT 等级检测工具,就能看到每个汉字具体属于哪个等级。两个工具的分工是:这个工具告诉你「汉字用量有多少」,等级检测工具告诉你「难度具体分布在哪」。

相关工具