这个工具的作用
删除重音符号将重音字母和特殊字母转换为它们的普通字母,“á”变成“a”,“ñ”变成“n”,“ç”变成“c”,同时保持文本的其余部分不变。它可以去除任何语言中的变音符号,一键将带重音的文本转换为干净的 ASCII 友好字母。
为什么要删除重音符号
许多系统仍然不能很好地处理重音字符。用户名、电子邮件地址、文件名、URL 段、数据库密钥和旧版软件通常需要简单的无重音字母。当像“José”这样的名字或像“São Paulo”这样的城市需要适合这些系统之一时,删除重音符号会产生兼容的版本。它还用于标准化搜索和匹配的文本,其中“cafe”和“café”应被视为相同。
它是如何运作的
该工具使用 Unicode 规范化将每个字母与其重音标记分开,然后删除这些标记,保持基本字母完好无损。它适用于法语、西班牙语、葡萄牙语、德语和许多其他语言,并处理各种变音符号,包括锐音、重音、扬抑符、波形符、元音变音和变音符号。底层字母和所有其他文本保持原样。
何时保留重音
删除重音符号是为了兼容性,而不是为了显示。在人们阅读文本的任何情况下,出版的文字、向用户显示的名称、正式文件、重音都是正确拼写的一部分,应该保留。 “São Paulo”和“Sao Paulo”在葡萄牙语中的正确性并不相同。当系统需要纯字母时使用此工具,而不是对正确重音文本进行常规清理。
当你需要删除重音符号时
删除重音符号和变音符号会将 á、é、ñ、ç 和 ü 等字母转换为其简单形式 a、e、n、c 和 u。当系统只接受基本的 ASCII 字母时,就需要这样做:从名称生成用户名或电子邮件、创建 URL slug、为旧数据库准备数据、标准化搜索词以使“Jose”与“José”匹配,或者生成跨操作系统的文件名。单词仍然可读,只是变音符号被删除。
重音消除的工作原理
在底层,每个重音字符都被分解为一个基本字母和一个组合标记,然后这些标记被丢弃,留下基本字母。这就是为什么“café”变成了“cafe”,“piñata”变成了“pinata”,而没有改变任何其他内容。它一次性处理多种语言的口音,包括西班牙语、葡萄牙语、法语、德语等。请注意,某些非拉丁文字不会以这种方式分解,因此该工具对于基于拉丁语的语言最有用。
口音、搜索和数据匹配
去除重音的一个常见原因是为了使搜索和匹配更加宽容。如果您的数据存储“São Paulo”,但用户输入“Sao Paulo”,则将两者规范化为非重音形式可以让它们匹配。这同样适用于对出现相同名称(带或不带重音符号)的列表进行重复删除。在比较之前删除重音符号会将接近重复的内容变成完全匹配的内容,这对于干净的数据和可靠的搜索至关重要。