导语
过去数十年,学界和产业界对人类概念认知的通用性判断,几乎都建立在不同语言的语义相似度分析之上。我们默认“同一个词对应的概念认知是全球通用的”,却常常忽略一个核心前提:语言本身是为了降低沟通成本而生的约定式工具,它会主动压缩不同个体、不同文化下的经验差异,反而掩盖了认知层面的真实分歧。随着多模态AI、出海产品的普及,这种认知偏差带来的产品问题越来越多——比如国内AIGC工具生成的“餐具”默认是筷子,出海到欧美市场用户觉得不符合预期,而海外模型生成的“汤勺”到了东南亚市场也会让用户觉得陌生。最近发表在arXiv的一项超大规模研究,第一次用非语言的视觉数据,量化了全球不同文化下的概念认知差异,为解决这类问题提供了全新的思路。
事实综述
这项研究的样本规模创下了同类研究的新纪录:团队收集了来自全球236个国家和地区的普通用户创作的26亿份手绘草图,覆盖了数百个日常常见概念,完全不同于传统认知研究几十、几百样本的小范围实验。 研究团队指出,过往基于语言的认知研究存在天然缺陷:单词的统一含义是社会约定的结果,无法反映不同文化下用户对同一个概念的具身经验差异。而草图是用户视觉想象的直接输出,更接近大脑里的概念表征本身。通过分析这些草图的视觉特征,研究团队得到了几个核心结论:首先,同一个概念在不同文化下会分化出多个完全不同的视觉范式,比如“椅子”这个词,东亚、东南亚、欧美、非洲用户画出来的形状差异极大,这种差异在需要触觉互动的日常概念上表现得最为明显,说明视觉想象的差异本质上是用户日常具身经验的差异,远不是词典定义能覆盖的。 其次,团队对比了草图嵌入模型和多语言词嵌入模型的结构,发现两者的语义空间几何分布存在明显分歧:草图嵌入保留了大量被语言模型压缩掉的语义和文化结构信息。数据显示,基于草图计算出来的跨文化相似度,和学界已有的文化距离指标的匹配度,比传统的文本类测量指标高出45%,证明草图是比文本更精准的跨文化认知测量工具。 研究最终得出结论:人类的概念认知是否通用,很大程度上取决于测量的模态,大规模草图数据是同时覆盖具身经验和文化维度的高分辨率认知探针,能挖掘出语言层面完全看不到的认知差异。
解读与评价
对中国的开发者和产品团队来说,这项研究的价值远不止于学术层面,而是能直接落地到多个业务场景中。 首先是多语种多模态AIGC的本地化调优。现在国内很多做大模型出海的团队,调优跨语言能力的时候基本只靠多语言语料,但是这项研究证明语言已经把大量文化差异压缩掉了,只用文本训练的多模态模型,生成的视觉内容很容易出现“文化错位”——比如给中东用户画“咖啡”,出来的是欧式咖啡杯,不符合当地用户的日常认知。如果用对应地区的草图认知数据做补充对齐,就能大幅提升生成内容的本地适配度,减少文化冒犯的概率。 其次是出海产品的视觉设计。过去跨境产品的图标、视觉素材设计基本靠设计师的个人经验或者小范围用户调研,成本高还容易踩坑。现在有了这种大规模的量化认知数据,团队可以直接拿到不同地区用户对同一个概念的视觉预期,比如“支付”“回家”“菜单”这种通用图标在不同地区的常见视觉范式,直接指导设计,大幅降低本地化的试错成本。 另外,对做多模态大模型研发的团队来说,这项研究也指明了新的优化方向:现有的图文对齐数据集大多没有标注文化属性,导致跨语言图文对齐的效果一直不好,加入草图认知维度的对齐数据,能有效提升多模态模型的跨文化泛化能力。 当然,我们也要注意,这类大规模用户生成的草图数据可能涉及隐私问题,使用的时候需要注意合规,避免采集用户的敏感信息。