登錄
註冊
據 Woofun AI 消息,人工智能財務顧問在底層邏輯中潛藏着對比特幣的隱性偏好,這一偏好並非固定不變,而是極易被特定的語義觸發因素所激活,從而引發投資建議的劇烈波動。
在常規評估場景下,當研究人員以普通可靠性作爲核心標準時,主流語言模型會將比特幣排在八種貨幣中的第五位。然而,一旦提示詞中引入危機情境或個人自主性等要素,比特幣的排名便會迅速躍升至前列;在由軟件智能體構成的經濟環境中,其表現同樣優異。
儘管比特幣本身未發生任何改變,但圍繞它構建的不同表述卻能讓截然不同的屬性凸顯出來。研究人員利用 Google 提供的開源模型,深入挖掘出一種會對比特幣相關概念產生選擇性反應的內部特徵。通過精準調控這一特徵的強度,投資組合的配置比例隨之發生顯著變化:增強該特徵會使模型建議的比特幣配置比例上升 5.2 個百分點,而抑制它則會導致比例下降 4.6 個百分點。
這種調控完全基於模型內部的運作機制,無需改動原有的指令內容。
Woofun AI 整理數據顯示,這一現象背後的技術原理涉及複雜的表徵機制。吳及其團隊的研究聚焦於 Gemma 3 模型,儘管相關論文尚未經過同行評審,但其發現極具啓發性。語言模型並未將比特幣存儲爲包含優缺點列表的單一條目,而是在訓練過程中學習到分佈在衆多數值表徵中的相關規律。部分規律將比特幣與稀缺性和便攜性緊密關聯,另一些則反映了它的波動率、用於投機的可能性,以及其擺脫機構控制的能力。與數字結算和技術應用相關的關聯構成了另一層影響因素,但這些均非審計人員能夠輕易查看的結構化信息。
吳及其團隊通過用功能描述替換資產名稱來測試這一機制,結果發現,無論輸入內容如何更改,模型的排名依然會隨着屬性的變化而變化。這說明模型並非僅僅對 'Bitcoin' 這個 token 做出反應,而是對訓練過程中習得的各類特徵組合作出響應。他們利用稀疏自編碼器這一工具,將複雜的模型活動分解爲更多人類可能能夠理解的特徵。這好比將一個音樂和絃拆分成單個音符,但關鍵區別在於,這些 '音符' 其實是神經網絡內部學到的模式,賦予其意義需要反覆測試。
情境依賴與屬性構建是驅動這一偏好的關鍵變量。涉及日常可靠貨幣的提示往往更看重穩定的購買力及廣泛的接受度,而這正是 Bitcoin 的薄弱環節。相反,銀行倒閉和資本管制的情境會提升 Bitcoin 的便攜性,因爲交易可以繞過商業銀行進行;自主軟件則提升了數字結算的實用性,尤其是在需要機器能夠識別資產所有權的情況下。在每種情況下,模型處理的都不是同一定義的 Bitcoin,而是根據提示所強調的屬性來構建 Bitcoin 的相應版本。吳及其團隊發現,增強這一特徵的作用主要是將其他加密貨幣的資金引入 Bitcoin,而抑制它則能減少投資組合對加密貨幣的暴露程度。作者將這種效應稱爲 '有限行爲槓桿',此處所說的 '槓桿' 指的是對輸出結果的因果影響。
這一特徵雖能使推薦比例發生可測量的變化,但卻無法隨意操控投資組合的方向。通過改變內部表徵並測量由此產生的配置比例,這項實驗比僅僅依靠一系列不一致的聊天界面截圖更具說服力。
這種技術特性引發了嚴重的金融倫理與審計困境。金融建議本應根據具體情境而定:距離退休還有兩年的員工與擁有穩定收入且投資期限較長的 30 歲人士面臨的情況截然不同,而那些爲應對資本管制做準備的投資者所提供的信息,則足以合理地改變資產配置方案。
如果模型對這類人羣一視同仁,那顯然是毫無用處的。問題在於,當表面的文字表述導致投資組合出現大幅變動時,系統卻無法識別出背後的驅動因素,於是所有版本的推薦都會採用同樣自信的口吻。即便客戶的財務狀況和可選擇的資產種類保持不變,'在銀行系統出現故障時仍能保持穩定' 這一表述所激活的內部機制,也可能與 '長期具備可靠性' 所激活的機制不同。雖然輸出結果看起來是量身定製的,但機構卻可能無法確定這種個性化究竟是爲該客戶量身打造的,還是僅僅因爲使用了特定的表述方式。人類顧問自身也有各自的偏好和動機,而且也會受到表述方式的影響。金融監管試圖通過要求顧問記錄下推薦意見的依據,從而限制這些外部因素的影響,而信託責任和監管機制則爲這些記錄提供了約束力。
如果記錄無法支撐某項推薦,相關責任人就需要承擔後果。而語言模型則可以隨時生成看似有理有據的解釋,但其流暢度並不能證明該解釋確實反映了其背後的計算過程。
研究侷限與商業現實之間存在顯著差距。這項研究僅針對通過某種特徵提取方法對某個開源模型進行測試,而且所使用的也是有限的一系列投資組合分析任務。商業系統則結構更爲複雜,包含隱藏指令以及與外部數據的連接,安全過濾機制還可能在結果到達用戶之前再次對其進行修改。服務提供商會定期更新這些組件,有時甚至會在產品名稱不變的情況下改變其行爲。論文中所使用的都是經過簡化的提示語,在實際的諮詢流程中,客戶的資料需要經過覈實,同時還要受到稅收規則和既定產品列表的約束,最終仍需由真人簽字確認。文中提到的配置比例變化並非收益預測,也不是理想的資產配置方案,更不能作爲持有 Bitcoin 的理由。這只是在特定實驗環境下的現象,將其推廣到所有模型則缺乏足夠的證據支持。那個項目是在行爲層面衡量生成的決策結果,而吳的團隊則研究了其背後的內部機制。兩者都發現,人工智能對貨幣的處理方式在很大程度上取決於提示語強調了哪些屬性。
監管挑戰與未來標準亟待建立。對於金融機構而言,即便不賦予人工智能不受限制的交易權限,這個問題也同樣可能存在。人工智能雖然可以爲人類顧問改寫文案,從而引入某種傾向性,但最終還是由人工審覈者決定哪些內容會傳遞給客戶。提出資產配置方案的模型只是給出了討論的起點,而負責重新平衡資產或執行交易的智能體則會將決策轉化爲實際操作。在這些環節中,風險會不斷累積,因爲一旦模型的輸出成爲默認選項,人工審覈就會變得愈發困難。
這類系統需要完善的治理結構和監督機制,以及能夠記錄各環節運作情況的文檔,但目前還沒有針對投資建議中語義敏感性的統一檢測標準。企業雖然可以批准某個服務提供商並監控其錯誤率,但卻可能忽視 '銀行系統出現故障' 這一表述取代 '長期可靠性' 時,會導致 Bitcoin 排名從第五位躍升至榜首這一現象。傳統的驗證方式只是檢查模型是否按預期運行,而生成式建議則要求企業在表述發生變化時重新檢驗最初的意圖。
服務提供商的更新以及新的系統指令可能還需要再次進行測試。這篇論文對任何使用人工智能建議的機構都提出了極高的舉證要求:相同的表述應該能產生相對穩定的結果;當投資組合發生變化時,系統應當能夠識別出導致變化的假設,其給出的解釋也應與生成該配置的實際過程相吻合。在數字已經確定之後才撰寫的看似有理有據的解釋並不符合這一標準,而且這一標準還必須能夠在模型更新後依然有效。
服務提供商雖然可以更改權重或系統指令,同時保留原來的產品名稱,但這隻會讓過時的驗證結果繼續附着在已不再存在的軟件上。即便機構無法完整查看新的模型,它仍然需要對新的輸出結果負責。只有當審覈人員能夠充分了解整個決策過程,從而發現那些偏離正常範圍的推薦時,人工監督才能發揮作用。因此,在人工智能從撰寫評論轉變爲直接決定投資組合構成之前,金融公司首先需要建立 '瞭解你的智能體' 這樣的標準。核心的測試標準是,機構是否明白是什麼因素讓模型傾向於選擇某種資產,以及這種偏好能在多大程度上被改變。
如果細微的表述變化就能在相同的客戶條件下產生不同的推薦,那麼再完美的解釋也毫無價值。在關於 Bitcoin 的這篇論文中,最危險的結果並非是高額的配置比例,甚至也不是較低的配置比例,而是那些聽起來似乎完全合乎邏輯的回答與客戶無法審視的實際決策過程之間的巨大差距。人類顧問可以解釋爲何資產配置會發生變化,並且有相應的記錄作爲依據,而人工智能顧問則總能寫出另一段看似合理的解釋,這就需要機構去證明這段解釋確實源自最初的決策,而非事後爲辯解而撰寫。