返回

跨境与多语言搜索:跨语种检索的架构与落地要点

通智云团队 ·
B2B出海 搜索系统 通智搜索
跨境与多语言搜索:跨语种检索的架构与落地要点

摘要:跨境搜索的关键不是把查询翻译一遍,而是让每个语种有自己的分词、归一与排序规则;可行架构是"语种专属分析 + 向量对齐 + 本地化排序"三层,缺一层就会在某一语种出现召回缺口。

同一款冲锋衣,德国买家搜"wasserdichte jacke",日本买家搜"防水 ジャケット",泰国买家输入一串没有空格的泰文。若只有一套按空格切分、按英文规则归一的检索链路,这三条查询基本都会召回不全。难点不在翻译准不准,而在分词、形态变化、字符归一与排序本地化四个层面,以及查询语言与文档语言不一致时如何对齐。本文按"问题—架构—分词—跨语言—排序—度量"展开,给出两张对比表与一份落地清单。

关键要点

一、多语言搜索为什么不是"翻译一下就行"

把多语言检索理解为"加一个翻译接口"是常见误判,翻译只处理表达差异,解决不了四类结构性问题。

分词。 中文、日文、泰文、老挝文、高棉文、缅甸文书写时没有空格。ICU 官方用户指南指出,这类语言的词边界不能仅靠字符序列规则判定,ICU 为中日泰老柬缅提供词典支持。沿用空格切词,整句会被当成一个词项,无法命中。

形态变化。 德语、俄语、波兰语、阿拉伯语、芬兰语靠词尾表达性、数、格。不做词干提取,"Schuhe"与"Schuh"、"книга"与"книги"就是两个无关词项,换个说法就召回不到。

字符集与编码。 同一个视觉字符在 Unicode 里可有多种表示:带变音符号的字母可能是一个码位,也可能是基础字母加组合符;还有全角半角、阿拉伯字母随位置变形、土耳其语特殊大小写。不归一,同一个词会有多个版本。

语序与复合词。 德语把多个名词拼成复合词,日韩是主宾谓结构,中文修饰语前置。按英文语序假设写的短语与邻近度规则,在其他语种上基本失效。

二、三种架构路线对比

架构选择的本质,是在检索质量、运维成本与跨语种能力之间取舍。

维度 ① 单语言多索引 ② 多语言混合索引 ③ 跨语言向量索引
核心做法 每语种一个索引与分析器 单索引 + language 字段 + 子字段 统一多语言 embedding + 向量库
同语种质量 最高 高,取决于字段拆分 中,语义强、精确弱
跨语种召回 不支持 不支持 天然支持,同一语义空间
存储与算力 随语种线性增长 单索引,字段膨胀 向量索引大,需近似检索
主要风险 成本线性上升 字段爆炸、打分难统一 型号与数字匹配不稳
适用场景 语种少、体量大 主力方案,内容同源 跨语种与长尾语种兜底

路线①适合语种固定、各语种体量都大的站点,分析器与排序规则可独立调优,代价是每加一语种就复制整套流程。路线②是多数跨境站点的选择:一份索引,language 字段标识语种,文本按语种拆子字段各绑分析器,查询时按语种路由。路线③用于补位而非替代——它在精确型号上不稳定,仍需关键词路托底。两路如何配合,可先读语义搜索是什么?向量检索与关键词检索全面对比。

三、分词与分析器:按语种选型

为什么不能用空格切中文?中文的最小语义单位不靠空格标识,"运动鞋男"会被切成四字词项,用户搜"男鞋 运动"时两侧无法对齐。解法有二:词典分词(IK、jieba 一类)可控但需维护行业词库;CJK 二元切分把连续汉字切成相邻二元组,召回高、无需词典,代价是索引膨胀。Elasticsearch 官方文档说明,该过滤器把中日韩文本切成二元组,非 CJK 输入原样透传。

语言 / 语系 主要难点 推荐分析链路 注意事项
中文 无空格,词边界靠语义 词典分词或 CJK 二元切分 二元切分噪声大;词典需维护词库
日文 汉字假名混排,无空格 Kuromoji 分词 + 假名归一 汉字、片假名、罗马字写法需归并
韩文 有空格但助词粘着 Nori 分词 + 助词去除 助词不去除会拖累长尾召回
泰文 / 老挝文 / 高棉文 无空格,需字典切分 ICU 分词器 混排英文数字时避免误切
德 / 法 / 西 / 俄 / 波兰 屈折与变格丰富 语言分析器 + Snowball 词干 词干过度归并伤精确召回
阿拉伯语 / 希伯来语 从右向左、字母随位置变形、有变音符号 语言分析器 + Unicode 归一 + ICU folding 变音符不归一会把同一词当两个词

工程提示:Elasticsearch 官方语言分析器已为阿拉伯语、德语、俄语等数十种语言提供预置配置,含停用词表与词干规则,优先复用;词干器归并较激进,型号与品牌名须加入排除列表;SKU、型号应设为 keyword 字段,不参与分词。

四、跨语言检索:查询是 A 语言、文档是 B 语言时怎么办

查询翻译:查询侧实时翻译后检索。优点是复用现有索引、改造成本最低;缺点是每次查询增加一次外部调用与延迟,多义词与行业术语易被译错,且错误发生在检索之前,排序阶段无法纠偏。

文档翻译:索引期把文档译成若干目标语种分别建索引。优点是查询侧零延迟;缺点是索引体积乘以语种数,译文质量参差会污染字段,原文一更新就要重翻。

多语言向量对齐:用多语言 embedding 把不同语言映射到共享语义空间,跨语言召回无需显式翻译。LaBSE 组合了掩码语言建模、翻译语言建模、双编码器翻译排序与加性间隔 softmax,在 Tatoeba 上于 112 种语言取得 83.7% 的双语文本检索准确率,明显高于此前的 65.5%,并发布覆盖 109 种以上语言的模型。开源的多语言 E5 系列先在十亿级多语言文本对上对比预训练再微调,提供三种尺寸供权衡。

三条路径不互斥:向量路做跨语种主召回,各语种关键词路精确保底,两路融合排序,术语与型号维护保护词表禁止翻译。权重调试见搜索相关性排序怎么优化?召回 + 排序双阶段方法。

五、排序侧的本地化

货币、单位与日期。 价格按站点货币存储并标明是否含税,排序与区间筛选用同一口径;尺寸重量按当地习惯换算;日期存在日/月与月/日两种顺序,千分位与小数分隔符也不同。这些应在查询解析阶段归一。

本地用词。 同一概念在不同市场叫法不同(football 与 soccer),同义词表必须按语种单独维护,不能跨语种复用。日语片假名外来语、西班牙语重音折叠等差异,应在分析阶段处理。

地区可用性。 可售区域、库存、物流时效、清关限制是硬约束,应作为召回阶段的过滤器而非扣分项——被区域规则排除的商品,相关性再高也不该出现。

合规与敏感内容。 各市场对禁售品类、内容分级、个人信息处理要求不同,屏蔽词表需按地区版本独立管理并保留审计记录。

六、效果度量与验收:为什么要分段看

最常见的度量错误是只看一个整体数字。若英文流量占七成,当德语与泰语召回率同时下滑 20% 时,整体指标可能只跌几个百分点,看起来仍在正常波动内——主力语种的量把小语种的崩塌平均掉了。

指标 分段维度 用途
零结果率 语种 × 地区 定位分词或索引缺失
首位点击率 语种 × 查询类型 判断排序本地化是否到位
标注集召回率@K 语种 跨语种横向比较质量
响应时延 P95 语种 × 地区 发现翻译或向量服务延迟

落地建议:每语种单独建立标注测试集,覆盖高频词、长尾词、型号词与自然语言提问四类,作为变更回归基线;看板默认按语种与地区下钻,并单独设告警阈值。分语种排查零结果的方法见站内搜索零结果率怎么降?8 个可落地策略。

七、落地清单

统一接入方式可参见通智云智能搜索:AI 驱动的站内搜索解决方案。

常见问题

问:多语言搜索是不是接一个翻译 API 就能解决?

答:不能。翻译只处理表达差异,解决不了分词、形态变化、字符归一与语序四类结构问题。无空格语言按空格切词会失效,屈折语言不做词干提取则复数与变格互不召回。翻译应是方案中的一环,而非全部。

问:应该为每个语种建一个索引,还是合到一个索引里?

答:语种少且体量都大时,分索引质量最好,可独立调优,但运维成本随语种线性增长。语种中等、内容同源的跨境站点更常用单索引加 language 字段、按语种拆子字段,把运维收敛到一套索引。

问:中文为什么不能用空格分词?

答:中文不靠空格标识词边界,按空格切分会把整句当成一个超长词项,只有原文完整出现才命中。解法有二:词典分词可控但需维护词库;CJK 二元切分把汉字切成相邻二元组,召回高但索引膨胀。

问:查询翻译和文档翻译该怎么选?

答:查询翻译改造成本最低,复用现有索引,但每次查询增加延迟,术语易译错且排序阶段无法纠偏。文档翻译查询侧零延迟,但索引体积乘以语种数、原文更新要重翻。多数团队改用向量对齐做跨语种召回。

问:多语言向量模型能替代关键词检索吗?

答:不能。向量模型在跨语种召回上优势明显,但对型号、编码、数字规格区分能力弱,易返回语义相近但规格错误的结果。正确做法是向量路做主召回、关键词路保底,两路融合并对术语做保护。

问:跨境搜索的效果指标为什么不能只看整体数字?

答:因为主力语种会稀释小语种的问题。若英文流量占七成,德语与泰语召回同时下滑 20%,整体指标可能只跌几个百分点,看起来仍在波动内。必须按语种与地区分段看零结果率、首位点击率与召回率。

关于通智云

通智搜索面向跨境与多语言检索场景,提供按语种配置的分析链路、关键词与向量双路召回融合排序,以及货币单位归一、地区可用性过滤与合规屏蔽能力。通智云(TENGENCE)是 AI 时代的企业增长引擎,专注公域引流获客与私域转化成交;核心产品为通智 GEO(GEO + SEO 双引擎)与通智搜索。

相关阅读

数据来源

  1. Unicode ICU《Text Boundary Analysis》:指出中日泰老柬缅书写无空格、词边界需词典支持,支撑"不能用空格切中文与泰文"的论断。
  2. Elasticsearch 官方指南《CJK bigram token filter》:说明该过滤器把中日韩文本切成二元组、非 CJK 输入原样透传,支撑中文二元切分方案。
  3. Elasticsearch 官方插件文档《ICU Analysis plugin》:插件用 ICU 库提供亚洲语言分析与 Unicode 归一、大小写折叠,支撑泰文等语种用 ICU 分词器。
  4. Elasticsearch 官方指南《Language analyzers》:列出阿拉伯语、德语、俄语等预置分析器的停用词、词干与排除词配置,支撑按语种选用官方分析器。
  5. arXiv《Language-agnostic BERT Sentence Embedding》(Feng 等,2022):LaBSE 在 Tatoeba 上于 112 种语言取得 83.7% 双语检索准确率,支撑多语言向量对齐路线可行。
  6. arXiv《Multilingual E5 Text Embeddings: A Technical Report》(Wang 等,2024):多语言 E5 先在十亿级多语言文本对上对比预训练再微调,支撑向量模型可按效率与质量权衡。

立即行动

免费试用通智云 | 免费预约专家咨询和诊断 | 了解通智搜索

← 上一篇: 通智云智能搜索:AI 驱动的站内搜索解决方案 下一篇 → 电商推荐系统选型指南:自研 vs 采购 vs SaaS
咨询 咨询
二维码

企业微信