翻译科普
多语言编码与翻译:从乱码到Unicode
早年用过外文软件的读者,多半见过「乱码」——满屏的方块和问号。乱码的本质,是「编码不一致」:同一个字节序列,用不同的编码表解读,就得到完全不同的字符。
早期各语言有自己的编码(中文GB2312/GBK、日文Shift-JIS、韩文EUC-KR),系统不识别就乱码。Unicode的诞生解决了这个混乱:它为全世界所有字符分配唯一编号(码点),UTF-8等编码方案统一了存储格式,乱码问题基本成为历史。
编码与翻译的关系:现代翻译工具处理多语言内容时,内部统一用Unicode,翻译前后的字符转换、存储、显示因此稳定可靠。这也让「中英日韩混合文本」的翻译成为可能。
对用户的价值:理解编码,你就知道「为什么翻译软件能同时处理几十种语言还不乱码」——不是它特别聪明,而是它站在Unicode的肩膀上。遇到历史文件乱码时,尝试切换编码(如UTF-8与GBK互转)往往就能修复。