分析文本嵌入保留与丢失的语言信息
原文:When Can We Work in Embedding Space? What Text Embeddings Preserve
文本嵌入何时可以作为实证分析的输入?其使用建立在一个假设之上:我们可以用文本换取其低维嵌入,且几乎不损失信息。我在一个文档为潜在主题混合物的生成模型下将这一假设精确化。我研究了两种用法——在嵌入空间中对单元进行聚类,以及对高维文本进行控制。一个嵌入簇对应一组主题混合物相似的文档;对嵌入进行控制等价于对主题混合物进行控制,因此有效性归结为该混合物是否捕捉了混杂因素。在一项针对美国363个都会区的应用中,基于嵌入的对LLM生成的经济描述的聚类恢复了可解释的经济原型,并且在区分本地就业动态方面比基于模型残差的聚类或基于精心挑选的行业与人口统计协变量的聚类更为敏锐。