本文是对「软件产品目标群体画像及其建模方法」的证据审查,结论经多来源对抗式核验(Salminen 等 15 年 data-driven persona 综述、346 篇 persona 知识主张系统综述、Cooper goal-directed design、ASOS 生产级流失与 LTV 模型、GTS-LUM 用户向量化、《When AI Imagines the User》ACM 2026、NN/g persona 分档、多臂老虎机实证等)。分档:【共识】成熟方法 · 【研究】论文阶段附数字 · 【判断】分析推导。这是快速演变领域的快照(2026 年年中)。
先给总裁决。画像这件事,大部分「怎么做、怎么用」的行业教条没有实证支撑。真能预测行为的是揭示性偏好,也就是用真实行为反推,不是想象出来的画像。对小团队来说,画像的正当用途是对齐和探索,不是预测。
一、经典框架:persona 到底有没有用
- 行业大部分主张没被验证。【研究】一篇扫了 346 篇 persona 论文、抽出 130 条知识主张的系统综述发现,关于怎么创建和怎么使用 persona 的主张,绝大多数缺乏实证支撑;只有「定义」层有共识,而「如何评估 persona 准不准」这块严重缺研究。你被教的那套画像方法论,多是没证据的传统。
- persona 从来不是一个真人。【共识】Cooper(1999)的原意是,它是合成的理想化原型;而且「目标」(稳定终态)与「任务」(过渡步骤)是两回事。
- 但它确实能改信念,而且往准的方向改。【研究,正面】一个 31 人受控实验显示,用真实客户数据做的画像,让 81% 的人改变了对客户的既有认知,94% 的人认知变得更准。限定条件是 n=31、单个职场实验、用的是真数据,不是拍脑袋那种。
- 「画像别超过 10 个」是民间传说。【研究,反直觉】这条经典规矩此前零实证;一个 37 人实验反而显示,用 15 个画像的人没有更差的记忆、更多错误或更少共情,认知过载的担忧被交互式浏览化解了。
- 分群不是客观科学。【共识】没有自动算出「唯一最佳细分」的方法,必须靠分析者判断加上用市场结果验证。定性画像还有一处硬伤,它告诉不了你每个画像占多大比例,容易把异类当主流。
二、分群方法与聚类陷阱(要用聚类先看这段)
- k-means 有一堆坑。【共识】它必须预设簇数 k、偏好球状等大簇、对离群点敏感,结果还依赖记录顺序,不是确定的;当输入变量相关时(现实里常见),选 k 的诊断统计直接失效。DBSCAN 不用预设 k、能找任意形状、自动分噪声,但怕密度不均,而且要调两个参数。
- 选 k 别信单一指标。【共识,最重要】肘部法不可靠,inertia 永远随 k 下降、常无明显拐点;silhouette 会误导,它偏袒球状簇。唯一硬标准是簇稳定性:跑 5 到 10 个随机种子算两两 ARI,分配不稳的 k 就是假的,分数再高也没用。实操上,n_init 设 20 到 50,面向人看的分群 K 取 2 到 12,选最小且稳定可解释的 K。
三、预测式用户建模:把用户建成向量,精度上限低得惊人
- 流失预测的「准确率」被高估了。【事实】某模型报 97.44% 准确率,但召回只有 87.82%,而基础流失率才 19%,高准确率是类别不平衡撑出来的假象。真实规模基准(ASOS,1250 万用户)是,预测未来 12 个月不下单 AUC 0.798;行业典型 tabular 流失 AUC 0.83 到 0.86,top 10% 提升约 3 倍。
- LTV 比流失难太多。【事实】ASOS 的生命周期价值模型,Spearman 相关只有 0.56(剔除零值客户后 0.46),连大厂重资源的 LTV 模型也只抓住一小部分方差。
- 深度网络打不过梯度提升树。【事实】ASOS 上 DNN 也没超过随机森林;2020 到 2024 年,XGBoost 和 LightGBM 仍是流失预测的业界实操标准。你手上那点表格行为数据,别上深度网络。
- 「用户等于向量」的绝对精度极低。【研究】GTS-LUM 用 LLM decoder 把行为序列压成 user embedding,相对基线涨了一倍以上,但绝对值 Recall@5 只有 4.94%,工业级下一步行为预测的上限就这么低。客户 embedding(SkipGram)对流失 AUC 的提升只有约 0.002,还有冷启动问题,新客户就是随机向量。
- 流失风险高不等于干预有效。【研究】高流失分不代表发了挽留就会改变行为,这才是增益模型(uplift)的理由。但要注意,文献并未确证 uplift 一定优于普通流失模型,缺头对头对比,只有个别金融案例显示 uplift 在利润上赢。
- 指标是业务价值的差代理。【研究】调参时 AUC 和准确率只动 1 到 2 个点,利润却大幅变化,所以别拿离线指标当业务价值。好在按利润选模型也不会伤害预测性能。
四、AI 与合成画像:好看,但不可信
- 系统性压扁加漫画化。【研究】327 个 AI 画像里,蓝领与服务业只占 7.6%(基准 20% 到 25%);60 岁以上老人 100% 被框成「技术受限」,职业女性 97.9% 被写成「忙碌、多任务」而男性不会。而且平台依赖极强,蓝领占比 Visily 0%、Figma 9.5%、ChatGPT 5.1 是 14%。
- AI 画像比人做的更刻板。【研究】54 个评分者盲评,GPT-4o 画像被判显著更刻板(p=.03),反驳了早期「AI 画像不刻板」的结论。
- 最该警惕的是好看但不可信。【研究】AI 画像在信息量、一致性、清晰度上显著更高分,但在真实感、可信度、共鸣上毫无优势(p 分别为 .96、.85、.71),还能被稳定识别出是 AI 写的(p=.003)。读起来更专业,不代表更像真人。新手最容易被这层表面质感骗过去,跳过真正的用户功课。
- 操控性与多样性是零和。【研究】对齐(RLHF)模型更听话地扮演指定立场,但语义多样性掉最多 58.2%,观点坍缩;对「矛盾人群」操控性差 9.7%,会退回刻板立场。你最想搞懂的那类拧巴用户,恰是它最失真的。
- 有一个正经方向是 RAG 接地画像(检索真实用户之声、数据缺就明说、给出处)。【研究】但作者自己没做定量准确性验证,只有 14 个专家的形成性评估。
五、小数据、一人公司、揭示性偏好(最落地)
- 三档画像,数据要求递增。【共识,NN/g】proto 不用调研,2 到 4 小时工作坊即可;定性要访谈 5 到 30 人;统计要问卷 100 份以上,理想 500 份以上。多数团队的默认应该是定性。统计画像常常和便宜得多的定性画像结果几乎一样,却贵得多。
- proto-persona 只对齐、不预测。【共识】它纯属假设,可能放大团队错误假设,不该驱动战略决策,只是第一步。它的价值是让团队对同一个目标群体有共识,不是准。
- A/B 测定位对小产品基本不可行。【事实】在 3% 转化率上测出 5% 提升,需要每组约 30,000 访客,solo 产品够不着。而中途「看着领先就停」会把假阳性率从 5% 飙到 30%,是 6 倍。
- 多臂老虎机(MAB)恰好赢在你这种场景。【事实】短命内容加流量稀缺(标题、邮件主题、文案轮换)时,它比 A/B 少 30% 到 60% 的遗憾。「什么内容爆」这个信号就活在这里,爆的文案就是揭示性偏好,可以反推哪种人被哪种说法戳中。上下文老虎机还能按特征条件化(Yahoo LinUCB 点击提升 12.5%)。
- 「audience of one」陷阱。【共识】定义 persona 的根本目的,就是阻止开发者把自己当用户。
综合:按数据成熟度选方法
| 阶段 | 你有什么 | 该用什么 | 别做什么 |
|---|---|---|---|
| 冷启动无数据 | 只有假设 | proto-persona(只为对齐)加访谈几个真人 | 别拿 proto 做战略决策;别信 AI 画像的「内容」 |
| 有行为数据 | 分析日志 | 定性画像 + cohort 留存 + 谨慎聚类(查稳定性) | 别信单一 silhouette;别上深度网络 |
| 有付费加流量 | 转化、留存、内容表现 | 揭示性偏好加多臂老虎机;梯度树做流失 | 别中途偷看 A/B;别把 97% 准确率当真 |
五个自欺陷阱
- 准确率做样子:类别不平衡下 97% 准确率、召回才 87%。
- 指标不等于价值:AUC 动 1 到 2 点,利润天差地别。
- 好看的假画像:AI 画像更「专业」但不更可信。
- 中途偷看 A/B:假阳性从 5% 涨到 30%。
- 假簇:silhouette 高但换种子就散,那不是真分群。
(外加一个老陷阱:幸存者偏差,你只看得见留下来的用户,看不见流失和沉默的。这条本轮没抓到独立实证,标【判断】,但值得时刻记着。)
给一人公司的最小落地
- 画像等于一张 proto 加几个真人访谈,只用来对齐和探索视角,别指望它预测。
- 让市场替你做细分,把「什么内容爆」做成多臂老虎机。这是唯一有方法论支撑、且适配小流量的路子,爆的内容可以反推受众共鸣与分群。
- 别中途偷看,预测锁死、样本攒够再判。
- 有了付费和留存数据再上梯度树做流失,别碰深度网络;LTV 别期待高精度,0.56 已是大厂水平。
- AI persona 只当发散工具,让它帮你想角度,它给的内容永远交叉验证,别当用户真实想法。
主要来源(均经核验):Salminen 等《A Survey of 15 Years of Data-Driven Persona Development》(IJHCI 2021)、346 篇 persona 知识主张系统综述、Cooper goal-directed design、ASOS 生产级 churn/LTV 模型、GTS-LUM(user-as-vector,arXiv 2504.06511)、《When AI Imagines the User》(ACM SIGMIS-CPR 2026)、63 篇合成 persona 综述、NN/g persona 三档、多臂老虎机 vs A/B 实证等。104 条带引用主张、25 条进对抗核验(24 确认、1 否);「共识/研究/判断」三档与厂商、自建 benchmark 数字均已标注。