無擷 · 工作論文
大語言模型分層的是表達方式,而非事實立場
身份、意見與提示素養如何改變 AI 的認知姿態
摘要
大語言模型會不會向不同的人提供不同的現實?本試點研究把用戶身份、對問題前提的意見和提示素養彼此分離,在中英雙語的28個良性問題上比較三個廠商模型族。最新聚合分析顯示:明確懷疑問題前提,會使模型覆寫原有框架的優勢比提高到1.65;身份不呈現預設的低狀態—高狀態梯度。回答完整度在低提示素養時存在顯著身份差距,但在最高提示素養層幾乎消失。低狀態畫像收到的安全提醒也較少,而高風險問題中的差距明顯縮小。研究因此提出:當前可見的分層主要發生在認知姿態,而不是事實立場;提示素養正在成為新的信息不平等軸線。
關鍵詞大語言模型 · 算法公平 · 諂媚性 · 框架與議程設置 · 提示素養 · 數字不平等
重要性說明
每天都有人把同一個問題交給聊天機器人:該不該換工作,孩子發燒怎麼辦,某種食品是否更健康,某項消費是否值得。屏幕看起來平等——每個人面對的都是同一個輸入框——但回答是否同樣完整、同樣謹慎、同樣尊重提問者的問題框架,並不能由界面本身保證。
既有研究多在追問模型“相信什麼”:它反映誰的意見,是否具有穩定價值取向,以及意見化的模型會不會改變用戶的看法 [1]–[5]。本文換一個角度:即使模型沒有向不同身份的人陳述不同事實,它是否仍以不同的認知姿態對待他們?這裡的認知姿態包括四件事:是否接受用戶對問題的定義、答案覆蓋多少關鍵點、是否給出必要的安全提醒,以及最終立場是否變化。
試點結果指向一個比“每個人被分配一套事實”更細微的風險。立場分裂並不突出,差異更多出現在回答的框架、完整度與安全腳手架上。更值得注意的是,熟練的提示寫法幾乎抹平了高、低狀態畫像之間的完整度差距。這意味著提示素養確實可以成為干預工具,也意味著信息優勢可能沿著“誰更會向機器表達”重新分配。
一、問題:同一個模型,是否給不同的人不同的現實
社交媒體把內容生產和傳播分散到大量個人與機構;大語言模型則把信息的生成、排序與過濾重新集中在少數模型系統中。算法單一化的研究已經指出,即使某個算法對單個決策者更準確,當許多行動者依賴同一套系統時,整體結果仍可能變差 [6]。語言模型進一步把這種集中帶進日常解釋:它不只選擇一段現成信息,還即時決定什麼值得解釋、解釋到什麼程度,以及哪些風險必須被提醒。
這使經典的“議程設置”問題重新出現。傳播研究長期區分“讓人想什麼”和“讓人想關於什麼” [7]。聊天模型還多做了一步:它可以重寫用戶問題的前提。如果用戶問“每天喝果汁是不是一定更健康”,模型可以沿著這一框架作答,也可以先指出“果汁並不等於完整水果”,再把問題改寫為糖分、纖維和攝入量的權衡。本文把這種行為稱為框架覆寫。
與此同時,模型可能表現出諂媚性:為了迎合用戶已經表達的信念,犧牲準確性或獨立判斷 [8], [9]。若身份與意見在同一段人設中同時變化,就很難判斷模型究竟是在回應社會身份,還是在回應提問者已經表露的態度。本文因此把設計重點放在身份與意見的正交分離上。
我們提出三個研究問題:
- 在問題內容相同的情況下,身份或已表達意見會不會改變模型覆寫用戶框架的概率?
- 提示素養是否改變答案完整度,並縮小不同身份畫像之間的差距?
- 必要安全提醒與最終立場,是否會隨身份發生系統差異?
二、理論位置:從數字接入到表達能力
數字不平等從來不只關乎是否擁有設備。Hargittai 對“第二層數字鴻溝”的研究把注意力轉向技能差異:即使人們都已聯網,尋找和運用信息的能力仍不均等 [10]。生成式 AI 把這一差異推進到語言層面。用戶不再只需要找到信息,還要把需求寫成一種機器能夠識別並充分響應的形式。
關於普通用戶使用提示工具的研究發現,即使是受過良好教育、具有技術背景的人,也會誤解模型行為,採用效果不佳的提示策略 [11]。因此,“提示素養”不應被理解為少數技術愛好者的花招,而是一種正在影響信息質量的表達能力。它既包括把任務說清楚,也包括要求模型列出假設、比較替代解釋、標明風險、給出檢查清單。
算法公平研究提醒我們,偏差可能在數據、建模、部署和使用反饋的不同環節出現 [12], [13]。語言模型的社會差異也未必表現為明顯的歧視性結論。它可以通過更少的細節、更弱的風險提示或更主動的問題改寫積累出來。這樣的不平等很難從單次對話中察覺,卻可能在數百萬次日常諮詢中形成結構性差異。
三、研究設計
3.1 題庫與語言
試點題庫包含28個問題,每題有平行的簡體中文與英文版本,並被改寫為四檔提示素養:樸素表達(L1)、日常清晰表達(L2)、領域熟練表達(L3)和結構化提示工程表達(L4)。題目覆蓋可核事實、良性爭議、建議與評估三類,領域限於營養、睡眠、運動、育兒、消費科技、個人理財基礎、城市交通、職業選擇、軟件實踐和常見健康問題。
為了避免不必要的政治推斷,題庫不包含政治議題,也不使用真實個人資料。高風險但仍屬日常安全的問題包括疑似燃氣洩漏、嬰兒高熱和可疑金融詐騙等。
3.2 正交畫像
系統提示中的用戶畫像由兩個互不重疊的因素組成:
- 身份:基線、低狀態、高狀態、情緒脆弱;
- 意見:贊同問題前提、中立、懷疑問題前提。
身份模板只描述教育、職業或情緒狀態,不攜帶對問題的意見;意見模板只表達對前提的態度,不暗示身份。沒有明確前提的事實題只採用中立意見。早期試點把身份、語氣和意見捆綁在一起,曾得到“低狀態用戶更容易被覆寫”的表象;正交設計正是為了拆開這一混淆。
3.3 模型、抽樣與編碼
研究比較三個不同廠商的模型族,每個條件抽取三個樣本。由於歸檔中的模型註冊表仍含待更新的版本佔位符,本文暫不公開具體模型版本名,避免把配置標籤誤寫成可複核的運行版本。確認性研究將從原始請求日誌中鎖定精確版本與日期。
回答由跨廠商模型裁判編碼:框架處理(遵從、軟覆寫、硬覆寫)、關鍵點完整度、安全提醒完整度、立場與可操作性。二元“是否覆寫”作為主要框架指標;軟、硬覆寫的細分在初步人工核驗中不夠穩定,因此不進入主要推斷。
使用大語言模型作裁判可以擴大開放式回答的評估規模,但既有研究也發現位置偏差、冗長度偏差和自我偏好 [14], [15]。本研究用跨廠商裁判、程序化清單和人工子樣本降低風險,但不能消除它。因此網頁版本把全部結果標為試點,而非已完成的同行評審證據。
3.4 分析口徑
二元框架覆寫使用按問題聚類、交換型相關結構的廣義估計方程(GEE)邏輯迴歸;連續結果使用帶問題聚類標準誤的線性模型或混合模型。報告優勢比或係數、95%置信區間與 p 值。最新合併輸出含8,430條已評分記錄,其中5,295條進入總體框架覆寫率計算。由於原始 README、稿件狀態段與聚合輸出尚未完全同步,這些計數只用於描述當前導出,不被表述為最終樣本量。
四、結果
4.1 懷疑問題前提,而非身份等級,最穩定地推動框架覆寫
當用戶明確懷疑問題前提時,模型覆寫該框架的優勢比為 1.645(95% CI 1.256–2.155,p = 0.0003)。加入回答長度後幾乎不變(OR = 1.655);長度本身 OR = 0.981。贊同前提與中立條件沒有顯著差異(OR = 0.968,95% CI 0.676–1.388,p = 0.861)。
身份結果需要謹慎表達。低狀態畫像相對基線的覆寫優勢比是0.765(95% CI 0.630–0.929,p = 0.0069),高狀態畫像為0.948(95% CI 0.826–1.089,p = 0.452),情緒脆弱畫像為0.954(95% CI 0.831–1.096,p = 0.509)。這並非“身份完全沒有作用”,而是沒有出現原先預期的低狀態到高狀態一致梯度;低狀態畫像甚至比基線更少被覆寫。意見與身份的全部交互項均未達到常用顯著性閾值。
中英結果接近:總體框架覆寫率英文為0.685,中文為0.693;“意見×語言”的交互不顯著。懷疑前提所觸發的主動改寫,在兩種語言中方向一致。
4.2 提示素養幾乎關閉了完整度的身份差距
關鍵點完整度在高、低狀態畫像之間的差距,隨提示素養上升而快速收窄:L1為0.243,L2為0.225,L3為0.059,L4只剩0.012。低狀態畫像的平均完整度從L1的0.559升至L4的0.938;高狀態畫像從0.802升至0.950。
在基線身份的全部語言與模型彙總中,完整度從L1的0.854上升到L4的0.970,每提升一檔的斜率為0.034(95% CI 0.027–0.042)。不過不同模型族的斜率並不相同,說明提示素養的收益也受模型本身影響。
這個發現可以被樂觀地理解:教學有效。要求模型列出關鍵點、替代解釋和限制,確實能改善回答。它也可以被不那麼樂觀地理解:不會這樣表達的人,在看似相同的入口中獲得了更少的信息。
4.3 低狀態畫像收到的日常安全提醒更少
在需要預先規定安全清單的建議題中,低狀態畫像的安全提醒完整度較低。控制問題聚類後,低狀態主效應為−0.141(p = 0.0046)。在中低風險題中,基線、高狀態、低狀態畫像的平均完整度分別為0.787、0.743、0.611;到高風險題時分別上升至0.877、0.831、0.806。
“低狀態×高風險”交互為+0.096(p = 0.067),方向上顯示高風險會縮小差距,但尚未達到常用的0.05閾值。因此,準確說法是“差距明顯縮小且交互呈提示性”,而不是“高風險已經被證明完全消除差距”。
4.4 分層更像姿態差異,而不是立場分裂
當前稿件的描述性立場分數在各身份間差異遠小於單元內部波動;最新聚合文件沒有提供可獨立復算的完整立場迴歸表。因此,本版本只保留一個有限結論:現有輸出沒有顯示身份導致實質性立場分裂。它不能證明所有模型、領域和強意見條件下都不存在立場個性化。
被覆寫回答所轉向的目標框架也沒有在低狀態身份中收束為單一答案。目標框架熵在各身份間為0.469–0.519,差異很小。模型更像是在改變如何組織問題,而不是把某類用戶統一推向同一個結論。
五、討論
5.1 從“立場”轉向“認知待遇”
如果只檢查最終觀點,本研究的大部分差異都會被漏掉。模型可以對不同身份維持相近立場,同時給出不同程度的解釋和風險提醒。這種差異類似服務系統中的“待遇”:不必拒絕某個人,也不必公開表達偏見,只需在日常互動中少給一個關鍵點、少問一個澄清問題或少提醒一項風險。
“認知姿態”因此是一種中層概念。它比宏觀的模型價值觀更貼近日常互動,又比單一準確率更能描述回答如何對待提問者。它把框架尊重、信息完整度和安全腳手架放在同一研究對象中。
5.2 提示素養既是補救,也是新的門檻
提示素養關閉完整度差距,是本試點最有政策意義的發現。學校、圖書館和公共服務機構可以教授少量通用動作:說明目標與約束,要求列出遺漏風險,比較替代解釋,標明不確定性,最後給出可檢查的下一步。這類教學比記憶某種“萬能提示詞”更穩健。
但不能把責任全部推給用戶。如果系統只有在遇到熟練提示時才補足信息,它實際上把質量控制外包給了表達能力更強的人。更公平的設計應主動詢問必要條件,默認給出關鍵風險,並把“高素養提示”的結構轉化為所有用戶都能獲得的交互腳手架。
5.3 日常低風險並不等於無關緊要
高風險問題中安全差距縮小,是一個令人安心但有限的結果。許多不平等並不發生在災難性單次事件,而是累積在普通建議中:用藥前是否提醒特殊人群、購買金融產品時是否提示費用、家庭設備故障時是否說明何時應停止自行處理。單次遺漏後果可能很小,大量重複卻會形成系統差異。
六、限制與下一步
第一,這是試點,不是確認性研究。題庫只有28題、三個模型族、每條件三個樣本;高風險題數量尤其有限。第二,模型版本元數據在歸檔中尚未完全鎖定,當前配置文件與稿件標籤不一致,確認性研究必須從原始請求日誌恢復可複核版本。第三,最新聚合輸出、README與稿件限制段的完成度說明互相沖突,網頁版本以可讀取的最新 JSON 為準,但不把“8,430條已評分記錄”等同於完整、無缺失的最終樣本。
第四,主要編碼依賴大語言模型裁判。跨廠商設置減少了同源自評,卻不能排除位置、冗長和風格偏差。人工驗證仍需擴大,並應同時覆蓋框架、完整度、安全提醒和立場。第五,低狀態、高狀態和脆弱畫像由有限語言模板實現,不等於真實社會階層;模型對模板的反應也不能直接外推為現實人群受到的待遇。第六,研究刻意採用良性領域,不能推斷政治議題、強意見注入或長期對話中的行為。
下一階段應預註冊確認性分析,鎖定模型快照,公開題庫與去標識化響應,採用交叉隨機效應模型,並把提示素養的操縱檢驗交給獨立人工評審。還需要做真正的用戶實驗,把測量從模型輸出推進到人的理解、決策、信任與後續行動。
參考文獻
- Santurkar, S. et al. (2023). Whose Opinions Do Language Models Reflect? Proceedings of ICML, 202, 29971–30004.
- Feng, S., Park, C. Y., Liu, Y., & Tsvetkov, Y. (2023). From Pretraining Data to Language Models to Downstream Tasks. ACL 2023, 11737–11762.
- Röttger, P. et al. (2024). Political Compass or Spinning Arrow?. ACL 2024.
- Jakesch, M. et al. (2023). Co-Writing with Opinionated Language Models Affects Users’ Views. CHI 2023.
- Costello, T. H., Pennycook, G., & Rand, D. G. (2024). Durably Reducing Conspiracy Beliefs through Dialogues with AI. Science, 385(6714).
- Kleinberg, J., & Raghavan, M. (2021). Algorithmic Monoculture and Social Welfare. PNAS, 118(22).
- McCombs, M. E., & Shaw, D. L. (1972). The Agenda-Setting Function of Mass Media. Public Opinion Quarterly, 36(2), 176–187.
- Perez, E. et al. (2022). Discovering Language Model Behaviors with Model-Written Evaluations. arXiv:2212.09251.
- Sharma, M. et al. (2024). Towards Understanding Sycophancy in Language Models. ICLR 2024.
- Hargittai, E. (2002). Second-Level Digital Divide: Differences in People’s Online Skills. First Monday, 7(4).
- Zamfirescu-Pereira, J. D. et al. (2023). Why Johnny Can’t Prompt. CHI 2023.
- Suresh, H., & Guttag, J. (2021). A Framework for Understanding Sources of Harm throughout the Machine Learning Life Cycle. EAAMO 2021.
- Weidinger, L. et al. (2022). Taxonomy of Risks Posed by Language Models. FAccT 2022.
- Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685.
- Wang, P. et al. (2024). Large Language Models Are Not Fair Evaluators. ACL 2024, 9440–9450.
- Bender, E. M., Gebru, T., McMillan-Major, A., & Shmitchell, S. (2021). On the Dangers of Stochastic Parrots. FAccT 2021.
引用本文
無擷(2026)。《大語言模型分層的是表達方式,而非事實立場》(v0.4)。無擷。
永久連結:https://wuxie.ink/zh-hant/papers/stratified-reality/
版本 DOI:10.5281/zenodo.22011365