當生成式AI(GenAI)已經懂得撰文、繪圖,甚至製作影片,我們可否借助它,去釐清人類社會錯綜複雜的因果關係?香港城市大學人文社會科學院(城大人院,簡稱CLASS)在「人院進階方法學講座」(CAMS)中,邀請美國哈佛大學政府學與統計學系講座教授今井耕介(Kosuke Imai)主講,介紹一套名為「生成式AI賦能推論」(GenAI Powered Inference,簡稱GPI)的新方法。他探討如何運用生成式AI,突破傳統研究的限制,從文字、圖像、影片這類「非結構化數據」中找出因果關係,把龐雜的資訊轉化為嚴謹可靠的研究成果。所謂「非結構化數據」,指的是沒有整齊格式、難以直接用表格或數字量度的資料,例如一段文章、一張相片或一條影片。

作為專汪研究方法的學者,今井教授笑言自己也曾向ChatGPT請教:怎樣用大型語言模型(Large Language Model)來提升研究?得到的答案不外乎「自動整理文獻」、「協助構思研究假設」等常規用途。他說:「我希望做更有創意的研究。」正是這股求新的動力,促使他與博士生中村健太郎(Kentaro Nakamura)等人一同構思出GPI框架,為社會科學研究開闢新路。
數碼DNA:萃取數據的精華
傳統研究最棘手的難題之一,正是處理文字、圖像和影片,因為當中夾雜大量互相交織、難以量度的訊息。以日常情景為例:下雨天,路人撐傘,地面同時變得濕滑。AI也許能準確預測「看到雨傘,地面多半是濕的」;但如果欠缺嚴謹的因果邏輯,AI就可能得出「雨傘令地面變濕」這種不合常理的結論。今井教授的GPI框架,正是要把AI由「盲目預測」,升級為「精準協助梳理因果」的研究工具。
具體做法是研究人員先把想分析的文字或影片,輸入一個公開免費的AI模型(如Llama 3),讓AI「重現」相同內容。在這個複製過程中,模型內部會生成一組由數千個數值組成的「內部表徵」(Internal Representation)。這組數值就像文字或影片的「數碼DNA」——把核心語意和畫面資訊濃縮成電腦可以分析的精華。掌握這串數碼DNA後,研究人員便可結合神經網絡與雙重機器學習(Double Machine Learning)等統計工具,準確捕捉真正的因果關係。雙重機器學習是一種統計技術,能同時處理「想研究的因素」和「需要排除的干擾因素」,因此即使毋須預設資料呈某種固定規律,也能有效過濾干擾,讓因果推算更可靠。

實證研究 解讀文字與影像訊息
今井教授以一項候選人個人簡介的研究實驗為例,生動展示GPI分析文字的能力。實驗請受訪者閱讀一位總統候選人的簡介,然後以0至100分評分。研究焦點在於:簡介有沒有提及候選人的軍事經驗?團隊透過Llama 3模型重現文本並提取內部表徵。
不過,兩份簡介除了「是否提及軍事經驗」之外,還可能在篇幅、教育背景、職業經歷和表達方式上各有不同,因此不能把評分差距全歸因於軍事背景。模擬結果顯示,在關鍵前提成立時,GPI估算出的偏差較小,信賴區間的表現也較理想——信賴區間指的是估算結果的可信範圍,範圍越集中,代表結果越穩定可靠。而且由於毋須重新訓練整個模型,運算速度更快。實證分析發現,當簡介提及軍事經驗,受訪者的好感度平均上升約5分;相比之下,傳統電腦科學模型卻得出負面或不穩定的結果,凸顯GPI在因果推論上的準確度。
更複雜的應用,來自一批選舉競選廣告影片。研究人員把影片剪成每5秒一段,標記候選人是否出現;受訪者一邊觀看廣告,一邊轉動一個0至100分的旋鈕,即時表達當下觀感。研究團隊用生成式AI重現畫面,又把對白轉成附時間標記的逐字稿,再交由Llama 3提取文字表徵,以便同時控制畫面和對白的差異。分析發現一個符合直覺的現象:當受訪者看到自己支持陣營的候選人露臉時,評價出現正面變化;相反,看到對立陣營的候選人時,評價則下降。GPI的「動態模型」還容許較早出現的畫面影響觀眾稍後的反應,這種隨時間推移的因果效應,為研究影片中「延後才發酵」的遞延效應,提供了新的分析途徑。

瑪利奧實驗 還原真實因果
這套高度依賴AI內部表徵的方法,能否排除「表面關聯」造成的誤導?團隊為此設計了一個別出心裁的實驗:讓AI試玩經典遊戲「超級瑪利歐」,並刻意安排「碧姬公主」較常在水管數量較多的畫面中出現。熟悉遊戲的玩家都知道,瑪利歐跳躍純粹是為了避開水管,跟碧姬公主是否出現毫無關係。若只看表面數據,可能會誤判「碧姬公主一出現,瑪利歐就跳得更多」;但GPI成功剔除水管數量的干擾,算出碧姬公主對跳躍的因果影響為「零」,清楚示範了如何避免把「相關」誤當成「因果」。
邁向未來 開源共享與技術擴展
今井教授強調,GPI框架的價值在於靈活與開放。團隊已開發出一套公開免費的Python工具包,協助學者處理文字或影片資料,包括重現數據、提取內部表徵和估算整體效果。他感嘆:「每年都有新模型面世,去年重現影片的質素還不夠理想,現在已經非常逼真。」隨着生成式AI不斷進化,社會科學的因果推論,正邁進一個充滿無限可能的新時代。