汉字密度分析工具
测算日语文本中汉字、平假名、片假名、罗马字的比例,用客观数据判断阅读难度与目标读者层。
常见问题
感觉我写的 JLPT 阅读材料太正式了,怎么在学生抱怨之前先自查?
把文章放进这个分析工具。如果目标读者是 N3 学生,但汉字密度落在学术/正式区间(超过 40%),这就是一个客观信号,说明需要改写。把汉字熟语换成假名混写或更简单的说法,一直改到密度落在 28%〜35% 区间再重新测一次。
中译日的稿子读起来很生硬,是不是汉字比例的问题?
从中文翻译过去时,很容易因为「反正汉字也看得懂」而把大量复合词原样保留成汉字,这是中文母语译者最容易踩的坑。如果轻松语境下的汉字密度超过 45%,通常就是该把复合词拆成假名混写形式的信号(比如 即時→すぐに)。先用这个工具定一个目标区间,再动手修改文本。
明明很认真写的日语博客,为什么读起来还是显得幼稚?
如果主题是商务、科技、金融这类成年读者期待正式文体的内容,而汉字密度低于 20%,无论词汇选得多讲究,读起来都会偏儿童向。可以把部分假名表达适当换回汉字,把密度提升到 25%〜32% 的休闲博客区间试试看。
怎么从一篇长的日语文章里提取出不重复的汉字列表?
粘贴文章后,从不重复汉字面板复制去重后的列表即可。列表按 Unicode 码位排序,可以直接导入 Anki,或者送进 JLPT 等级检测工具做进一步的难度分析。
工作流程
汉字密度分析工具 是什么?
「这段日语怎么读起来这么生硬」「这段又显得太幼稚」——编辑和写作者调整文体时,凭的往往只是直觉,而这种直觉背后的真正变量,很大程度上就是汉字密度。同样的内容,多用假名写开会显得轻快,多用汉字收紧则显得正式、书面化。问题是大多数人只是凭感觉调整,从来没有一个客观数字告诉自己「现在到底是多少」。
本工具会逐字符判断输入文本属于哪种文字系统:汉字(CJK 统一表意文字及扩展区)、平假名、片假名(含半角片假名)、罗马字(全角/半角)、数字、标点、空白,以及其他符号。汉字密度是相对于「除去空白后的可见字符数」计算的,所以无论原文的换行方式或空格习惯如何,这个百分比都能保持稳定、可比较。
这个工具对中国读者尤其有用:中文母语者写日语或做中译日翻译时,因为汉字本身「看得懂」,很容易不自觉地保留过多汉字词,写出来的日语在日本人看来会显得生硬、翻译腔很重——而这恰恰是可以用一个数字量化出来的问题。
如何使用 汉字密度分析工具
1. 把要分析的日语文本粘贴到输入框。
2. 各文字类型的统计、汉字密度进度条、不重复汉字列表会立即刷新。
3. 把汉字密度对照参考区间:低于 20% 偏儿童/入门向,20%〜30% 偏轻松随笔,30%〜40% 接近新闻/商务文体,40%〜50% 偏学术/正式,50% 以上偏法律/专业文档。
4. 复制不重复汉字列表用于背单词,或者用来检查是否覆盖了目标 JLPT 等级的汉字。
示例
示例段落(40个可见字符):
• 汉字 12字(30.0%)— 接近新闻/商务文体
• 平假名 18字(45.0%)
• 片假名 6字(15.0%)
• 罗马字 0字(0.0%)
• 标点 4字(10.0%)应用场景
1. JLPT 教材编写者检查 N3 阅读文章的汉字密度是否超过 30%。
2. 编辑把文体调整到接近 Yahoo!新闻或博客的语感(28%〜34%),避免写得过于像教科书。
3. 译者检查中译日的稿件是否残留了过多汉字词,读起来偏生硬。
4. 研究者在选择合适的分词工具之前,先了解语料库的文字类型构成。
常见问题
空白字符会怎样影响密度百分比?
空白会被单独统计,但不计入密度计算的分母(可见字符数)。所以无论原文换行习惯如何,或者用了多少全角空格( ),汉字密度的数值都能保持稳定,方便前后对比。
为什么把 30%〜40% 定义为「新闻/商务」区间?
对朝日新闻、读卖新闻等主流日本报纸以及企业文书的实证调查显示,汉字密度大多落在 30%〜37% 之间。JLPT N3 阅读题通常在 28%〜32% 左右,轻小说多数在 25%〜32%。这些区间只是用于横向比较的参考,不是绝对标准。
不重复汉字列表能用来检查 JLPT 等级覆盖情况吗?
可以。把列表复制粘贴进 JLPT 等级检测工具,就能看到每个汉字具体属于哪个等级。两个工具的分工是:这个工具告诉你「汉字用量有多少」,等级检测工具告诉你「难度具体分布在哪」。