几乎所有 AI 干活之前,都要先做这件事:把万物「翻译成数字」。一句话先记住它 👇
文字、图片、一条评论、一个客户——计算机眼里都不是「意思」,只是一堆符号。
把每个东西转成一串能反映它本质特征的数字,AI 才能拿来计算、比较、判断。
把一串数字想成地图上的坐标——意思越像的东西,坐标就越挨在一起。
表征就是给每个东西一组坐标。妙处在于:意思相近的,坐标也相近;八竿子打不着的,离得老远。于是「猫」和「狗」凑一块儿,「汽车」就在另一头。AI 不用真的「懂」猫狗,只要看坐标远近,就知道谁跟谁像。
关键就在那个「学习」二字——坐标不是人定的,是模型从海量数据里自己摸出来的。
人来想:要不要看「长几条腿」「有没有毛」……费脑、死板,换个场景就得重来,很多说不清的特征根本填不出。
把海量数据喂进去,让模型自己摸出该用哪些坐标。学好的标准很朴素:该像的挨在一起,不相干的离得远。
Akke 要判断抖音评论的购买意向。没人能把「什么样算高意向」一条条写死——
让模型自己学:喂进海量真实评论,它自己学会把「多少钱」「在哪家店」这类高意向评论的坐标,放到挨在一起的位置。这套坐标,就是它学出来的表征。
一旦评论和客户都有了坐标,很多原本要人盯的活,都变成了「量距离」。
新评论一来,看它的坐标落在「高意向」那堆附近,还是「凑热闹」那堆——自动打分。
成交过一个客户,就去坐标附近捞「长得像」的客户,优先跟进。
「找意思相近的内容」不再靠关键词死磕,而是按坐标远近捞——这就是 RAG / 智能检索的地基。
客户的话先转成坐标,AI 才能听懂「言外之意」,接得上、答得准。
判断一套表征学得好不好,看这三条就够了。
该像的挨在一起,不相干的离得远。这是好表征的命根子。
学一次,到处能用——同一套坐标既能分意向、也能找相似、还能喂给聊天。
抓的是「意思」,不是表面字眼。换个说法但同一个意图,坐标依然靠近。