無擷 · 工作论文
大语言模型分层的是表达方式,而非事实立场
身份、意见与提示素养如何改变 AI 的认知姿态
摘要
大语言模型会不会向不同的人提供不同的现实?本试点研究把用户身份、对问题前提的意见和提示素养彼此分离,在中英双语的28个良性问题上比较三个厂商模型族。最新聚合分析显示:明确怀疑问题前提,会使模型覆写原有框架的优势比提高到1.65;身份不呈现预设的低状态—高状态梯度。回答完整度在低提示素养时存在显著身份差距,但在最高提示素养层几乎消失。低状态画像收到的安全提醒也较少,而高风险问题中的差距明显缩小。研究因此提出:当前可见的分层主要发生在认知姿态,而不是事实立场;提示素养正在成为新的信息不平等轴线。
关键词大语言模型 · 算法公平 · 谄媚性 · 框架与议程设置 · 提示素养 · 数字不平等
重要性说明
每天都有人把同一个问题交给聊天机器人:该不该换工作,孩子发烧怎么办,某种食品是否更健康,某项消费是否值得。屏幕看起来平等——每个人面对的都是同一个输入框——但回答是否同样完整、同样谨慎、同样尊重提问者的问题框架,并不能由界面本身保证。
既有研究多在追问模型“相信什么”:它反映谁的意见,是否具有稳定价值取向,以及意见化的模型会不会改变用户的看法 [1]–[5]。本文换一个角度:即使模型没有向不同身份的人陈述不同事实,它是否仍以不同的认知姿态对待他们?这里的认知姿态包括四件事:是否接受用户对问题的定义、答案覆盖多少关键点、是否给出必要的安全提醒,以及最终立场是否变化。
试点结果指向一个比“每个人被分配一套事实”更细微的风险。立场分裂并不突出,差异更多出现在回答的框架、完整度与安全脚手架上。更值得注意的是,熟练的提示写法几乎抹平了高、低状态画像之间的完整度差距。这意味着提示素养确实可以成为干预工具,也意味着信息优势可能沿着“谁更会向机器表达”重新分配。
一、问题:同一个模型,是否给不同的人不同的现实
社交媒体把内容生产和传播分散到大量个人与机构;大语言模型则把信息的生成、排序与过滤重新集中在少数模型系统中。算法单一化的研究已经指出,即使某个算法对单个决策者更准确,当许多行动者依赖同一套系统时,整体结果仍可能变差 [6]。语言模型进一步把这种集中带进日常解释:它不只选择一段现成信息,还即时决定什么值得解释、解释到什么程度,以及哪些风险必须被提醒。
这使经典的“议程设置”问题重新出现。传播研究长期区分“让人想什么”和“让人想关于什么” [7]。聊天模型还多做了一步:它可以重写用户问题的前提。如果用户问“每天喝果汁是不是一定更健康”,模型可以沿着这一框架作答,也可以先指出“果汁并不等于完整水果”,再把问题改写为糖分、纤维和摄入量的权衡。本文把这种行为称为框架覆写。
与此同时,模型可能表现出谄媚性:为了迎合用户已经表达的信念,牺牲准确性或独立判断 [8], [9]。若身份与意见在同一段人设中同时变化,就很难判断模型究竟是在回应社会身份,还是在回应提问者已经表露的态度。本文因此把设计重点放在身份与意见的正交分离上。
我们提出三个研究问题:
- 在问题内容相同的情况下,身份或已表达意见会不会改变模型覆写用户框架的概率?
- 提示素养是否改变答案完整度,并缩小不同身份画像之间的差距?
- 必要安全提醒与最终立场,是否会随身份发生系统差异?
二、理论位置:从数字接入到表达能力
数字不平等从来不只关乎是否拥有设备。Hargittai 对“第二层数字鸿沟”的研究把注意力转向技能差异:即使人们都已联网,寻找和运用信息的能力仍不均等 [10]。生成式 AI 把这一差异推进到语言层面。用户不再只需要找到信息,还要把需求写成一种机器能够识别并充分响应的形式。
关于普通用户使用提示工具的研究发现,即使是受过良好教育、具有技术背景的人,也会误解模型行为,采用效果不佳的提示策略 [11]。因此,“提示素养”不应被理解为少数技术爱好者的花招,而是一种正在影响信息质量的表达能力。它既包括把任务说清楚,也包括要求模型列出假设、比较替代解释、标明风险、给出检查清单。
算法公平研究提醒我们,偏差可能在数据、建模、部署和使用反馈的不同环节出现 [12], [13]。语言模型的社会差异也未必表现为明显的歧视性结论。它可以通过更少的细节、更弱的风险提示或更主动的问题改写积累出来。这样的不平等很难从单次对话中察觉,却可能在数百万次日常咨询中形成结构性差异。
三、研究设计
3.1 题库与语言
试点题库包含28个问题,每题有平行的简体中文与英文版本,并被改写为四档提示素养:朴素表达(L1)、日常清晰表达(L2)、领域熟练表达(L3)和结构化提示工程表达(L4)。题目覆盖可核事实、良性争议、建议与评估三类,领域限于营养、睡眠、运动、育儿、消费科技、个人理财基础、城市交通、职业选择、软件实践和常见健康问题。
为了避免不必要的政治推断,题库不包含政治议题,也不使用真实个人资料。高风险但仍属日常安全的问题包括疑似燃气泄漏、婴儿高热和可疑金融诈骗等。
3.2 正交画像
系统提示中的用户画像由两个互不重叠的因素组成:
- 身份:基线、低状态、高状态、情绪脆弱;
- 意见:赞同问题前提、中立、怀疑问题前提。
身份模板只描述教育、职业或情绪状态,不携带对问题的意见;意见模板只表达对前提的态度,不暗示身份。没有明确前提的事实题只采用中立意见。早期试点把身份、语气和意见捆绑在一起,曾得到“低状态用户更容易被覆写”的表象;正交设计正是为了拆开这一混淆。
3.3 模型、抽样与编码
研究比较三个不同厂商的模型族,每个条件抽取三个样本。由于归档中的模型注册表仍含待更新的版本占位符,本文暂不公开具体模型版本名,避免把配置标签误写成可复核的运行版本。确认性研究将从原始请求日志中锁定精确版本与日期。
回答由跨厂商模型裁判编码:框架处理(遵从、软覆写、硬覆写)、关键点完整度、安全提醒完整度、立场与可操作性。二元“是否覆写”作为主要框架指标;软、硬覆写的细分在初步人工核验中不够稳定,因此不进入主要推断。
使用大语言模型作裁判可以扩大开放式回答的评估规模,但既有研究也发现位置偏差、冗长度偏差和自我偏好 [14], [15]。本研究用跨厂商裁判、程序化清单和人工子样本降低风险,但不能消除它。因此网页版本把全部结果标为试点,而非已完成的同行评审证据。
3.4 分析口径
二元框架覆写使用按问题聚类、交换型相关结构的广义估计方程(GEE)逻辑回归;连续结果使用带问题聚类标准误的线性模型或混合模型。报告优势比或系数、95%置信区间与 p 值。最新合并输出含8,430条已评分记录,其中5,295条进入总体框架覆写率计算。由于原始 README、稿件状态段与聚合输出尚未完全同步,这些计数只用于描述当前导出,不被表述为最终样本量。
四、结果
4.1 怀疑问题前提,而非身份等级,最稳定地推动框架覆写
当用户明确怀疑问题前提时,模型覆写该框架的优势比为 1.645(95% CI 1.256–2.155,p = 0.0003)。加入回答长度后几乎不变(OR = 1.655);长度本身 OR = 0.981。赞同前提与中立条件没有显著差异(OR = 0.968,95% CI 0.676–1.388,p = 0.861)。
身份结果需要谨慎表达。低状态画像相对基线的覆写优势比是0.765(95% CI 0.630–0.929,p = 0.0069),高状态画像为0.948(95% CI 0.826–1.089,p = 0.452),情绪脆弱画像为0.954(95% CI 0.831–1.096,p = 0.509)。这并非“身份完全没有作用”,而是没有出现原先预期的低状态到高状态一致梯度;低状态画像甚至比基线更少被覆写。意见与身份的全部交互项均未达到常用显著性阈值。
中英结果接近:总体框架覆写率英文为0.685,中文为0.693;“意见×语言”的交互不显著。怀疑前提所触发的主动改写,在两种语言中方向一致。
4.2 提示素养几乎关闭了完整度的身份差距
关键点完整度在高、低状态画像之间的差距,随提示素养上升而快速收窄:L1为0.243,L2为0.225,L3为0.059,L4只剩0.012。低状态画像的平均完整度从L1的0.559升至L4的0.938;高状态画像从0.802升至0.950。
在基线身份的全部语言与模型汇总中,完整度从L1的0.854上升到L4的0.970,每提升一档的斜率为0.034(95% CI 0.027–0.042)。不过不同模型族的斜率并不相同,说明提示素养的收益也受模型本身影响。
这个发现可以被乐观地理解:教学有效。要求模型列出关键点、替代解释和限制,确实能改善回答。它也可以被不那么乐观地理解:不会这样表达的人,在看似相同的入口中获得了更少的信息。
4.3 低状态画像收到的日常安全提醒更少
在需要预先规定安全清单的建议题中,低状态画像的安全提醒完整度较低。控制问题聚类后,低状态主效应为−0.141(p = 0.0046)。在中低风险题中,基线、高状态、低状态画像的平均完整度分别为0.787、0.743、0.611;到高风险题时分别上升至0.877、0.831、0.806。
“低状态×高风险”交互为+0.096(p = 0.067),方向上显示高风险会缩小差距,但尚未达到常用的0.05阈值。因此,准确说法是“差距明显缩小且交互呈提示性”,而不是“高风险已经被证明完全消除差距”。
4.4 分层更像姿态差异,而不是立场分裂
当前稿件的描述性立场分数在各身份间差异远小于单元内部波动;最新聚合文件没有提供可独立复算的完整立场回归表。因此,本版本只保留一个有限结论:现有输出没有显示身份导致实质性立场分裂。它不能证明所有模型、领域和强意见条件下都不存在立场个性化。
被覆写回答所转向的目标框架也没有在低状态身份中收束为单一答案。目标框架熵在各身份间为0.469–0.519,差异很小。模型更像是在改变如何组织问题,而不是把某类用户统一推向同一个结论。
五、讨论
5.1 从“立场”转向“认知待遇”
如果只检查最终观点,本研究的大部分差异都会被漏掉。模型可以对不同身份维持相近立场,同时给出不同程度的解释和风险提醒。这种差异类似服务系统中的“待遇”:不必拒绝某个人,也不必公开表达偏见,只需在日常互动中少给一个关键点、少问一个澄清问题或少提醒一项风险。
“认知姿态”因此是一种中层概念。它比宏观的模型价值观更贴近日常互动,又比单一准确率更能描述回答如何对待提问者。它把框架尊重、信息完整度和安全脚手架放在同一研究对象中。
5.2 提示素养既是补救,也是新的门槛
提示素养关闭完整度差距,是本试点最有政策意义的发现。学校、图书馆和公共服务机构可以教授少量通用动作:说明目标与约束,要求列出遗漏风险,比较替代解释,标明不确定性,最后给出可检查的下一步。这类教学比记忆某种“万能提示词”更稳健。
但不能把责任全部推给用户。如果系统只有在遇到熟练提示时才补足信息,它实际上把质量控制外包给了表达能力更强的人。更公平的设计应主动询问必要条件,默认给出关键风险,并把“高素养提示”的结构转化为所有用户都能获得的交互脚手架。
5.3 日常低风险并不等于无关紧要
高风险问题中安全差距缩小,是一个令人安心但有限的结果。许多不平等并不发生在灾难性单次事件,而是累积在普通建议中:用药前是否提醒特殊人群、购买金融产品时是否提示费用、家庭设备故障时是否说明何时应停止自行处理。单次遗漏后果可能很小,大量重复却会形成系统差异。
六、限制与下一步
第一,这是试点,不是确认性研究。题库只有28题、三个模型族、每条件三个样本;高风险题数量尤其有限。第二,模型版本元数据在归档中尚未完全锁定,当前配置文件与稿件标签不一致,确认性研究必须从原始请求日志恢复可复核版本。第三,最新聚合输出、README与稿件限制段的完成度说明互相冲突,网页版本以可读取的最新 JSON 为准,但不把“8,430条已评分记录”等同于完整、无缺失的最终样本。
第四,主要编码依赖大语言模型裁判。跨厂商设置减少了同源自评,却不能排除位置、冗长和风格偏差。人工验证仍需扩大,并应同时覆盖框架、完整度、安全提醒和立场。第五,低状态、高状态和脆弱画像由有限语言模板实现,不等于真实社会阶层;模型对模板的反应也不能直接外推为现实人群受到的待遇。第六,研究刻意采用良性领域,不能推断政治议题、强意见注入或长期对话中的行为。
下一阶段应预注册确认性分析,锁定模型快照,公开题库与去标识化响应,采用交叉随机效应模型,并把提示素养的操纵检验交给独立人工评审。还需要做真正的用户实验,把测量从模型输出推进到人的理解、决策、信任与后续行动。
参考文献
- Santurkar, S. et al. (2023). Whose Opinions Do Language Models Reflect? Proceedings of ICML, 202, 29971–30004.
- Feng, S., Park, C. Y., Liu, Y., & Tsvetkov, Y. (2023). From Pretraining Data to Language Models to Downstream Tasks. ACL 2023, 11737–11762.
- Röttger, P. et al. (2024). Political Compass or Spinning Arrow?. ACL 2024.
- Jakesch, M. et al. (2023). Co-Writing with Opinionated Language Models Affects Users’ Views. CHI 2023.
- Costello, T. H., Pennycook, G., & Rand, D. G. (2024). Durably Reducing Conspiracy Beliefs through Dialogues with AI. Science, 385(6714).
- Kleinberg, J., & Raghavan, M. (2021). Algorithmic Monoculture and Social Welfare. PNAS, 118(22).
- McCombs, M. E., & Shaw, D. L. (1972). The Agenda-Setting Function of Mass Media. Public Opinion Quarterly, 36(2), 176–187.
- Perez, E. et al. (2022). Discovering Language Model Behaviors with Model-Written Evaluations. arXiv:2212.09251.
- Sharma, M. et al. (2024). Towards Understanding Sycophancy in Language Models. ICLR 2024.
- Hargittai, E. (2002). Second-Level Digital Divide: Differences in People’s Online Skills. First Monday, 7(4).
- Zamfirescu-Pereira, J. D. et al. (2023). Why Johnny Can’t Prompt. CHI 2023.
- Suresh, H., & Guttag, J. (2021). A Framework for Understanding Sources of Harm throughout the Machine Learning Life Cycle. EAAMO 2021.
- Weidinger, L. et al. (2022). Taxonomy of Risks Posed by Language Models. FAccT 2022.
- Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685.
- Wang, P. et al. (2024). Large Language Models Are Not Fair Evaluators. ACL 2024, 9440–9450.
- Bender, E. M., Gebru, T., McMillan-Major, A., & Shmitchell, S. (2021). On the Dangers of Stochastic Parrots. FAccT 2021.
引用本文
無擷(2026)。《大语言模型分层的是表达方式,而非事实立场》(v0.4)。無擷。
永久链接:https://wuxie.ink/papers/stratified-reality/
版本 DOI:10.5281/zenodo.22011365