AI 模型事實判斷分歧大 新研究揭僅三成共識

Date:

圖/示意圖

商傳媒|葉安庭/綜合外電報導

一項最新研究揭露,多款領先的人工智慧(AI)模型在判斷基本事實時,經常出現嚴重的分歧,引發外界對 AI 可靠性的疑慮。這份由 Lenz Research 研究員 Kosta Jordanov 主導的調查指出,受測的五款 AI 模型對用戶提交的事實聲明,僅有約三成能達成共識。

該研究測試了 GPT-5.4、Claude Opus 4.7、Gemini 3 Pro、Gemini 3 Pro with Search 以及 Sonar Pro 等多個人工智慧模型。研究團隊將 1,000 個提交至事實查核平台的聲明,要求這些模型判斷其為「真」、「大致為真」、「誤導性」或「假」。結果顯示,模型在 672 個聲明上存在分歧,佔總數約三分之二。

值得注意的是,其中有 34% 的聲明出現嚴重分歧,意即某個模型將聲明標示為「真」,另一個模型卻標示為「假」,這種截然不同的判斷可能在實際應用中造成混淆。研究進一步發現,這五個模型僅在 328 個聲明上達成一致判斷,且幾乎所有的一致都落在「真」或「假」的明確結論。對於那些處於「灰色地帶」、需要細緻判斷才能歸類為「大致為真」或「誤導性」的聲明,模型間的一致性則顯著降低,例如僅有 4 個聲明被一致標記為「誤導性」,沒有任何聲明被一致標記為「大致為真」。

這項發現對於企業組織將 AI 導入需要高精確度與信任的工作流程時,無疑是一項重要警訊。儘管單一 AI 模型的回應可能顯得自信,但當其他領先系統給出不同分類時,這將使得僅憑模型信心來替代實質證據的做法更難成立。研究特別提醒,在商業環境中,這種不一致性可能影響團隊對政策語言和風險的評估。

不過,研究並非全盤否定 AI 在事實驗證工作中的價值。Kosta Jordanov 強調,AI 仍能協助收集資訊並提供有用的背景資訊。然而,組織必須建立明確的控管措施,審查 AI 產生的事實性答案,要求 AI 提供引用來源,並訂定何時必須由主題專家進行審查。這項研究呼籲各界應理性看待 AI 生成的內容,並加強對資訊的查證能力,而非盲目信賴 AI 的判斷。

9237e8aa 74dd 40e2 83fe 85b19e124ae9

相關新聞推薦

正在載入相關新聞…

Share post:

spot_imgspot_img

熱門

相關新聞
Related

響應AI新十大建設浪潮—智域Novaryn Labs攜手產業推動科技創新、人才培育與永續發展

「智域Novaryn Labs」以科技創新驅動未來,以永續公益創造價值,攜手迎接AI智慧新時代。在AI時代快速到來之際,智域Novaryn Labs持續投入科技創新推廣、AI產業交流、數位轉型教育及人才培育工作,並結合永續發展與公益理念,積極參與智慧科技生態圈建設,希望透過跨領域合作與資源整合,共同推動台灣產業升級與人才發展。

從一場旅行找到人生方向—永續生活倡導者劉鴻鑫打造「晴日悠境」推廣旅行與素食文化:打造結合健康、交流與善念的生活平台

永續生活倡導者劉鴻鑫秉持「以旅行拓展視野、以素食尊重生命」的理念,創立結合旅行、健康與素食文化的交流平台—晴日悠境,希望透過社群凝聚志同道合的人,一同分享生活、交流想法,實踐健康、友善且充滿善念的生活方式。

回顧花蓮震後重建之路!「晨曦綠苑」晨爸范昊晨團隊無私奉獻:去年923熱血身影成災民心中最暖陽光

花蓮近年經歷多次大自然考驗,在各界攜手努力下,災區已逐步走出陰霾、重現生機。回顧去年(2025年)9月23日災情最為嚴峻的時刻,知名民間力量「晨曦綠苑」與創辦人范昊晨(晨爸)團隊在第一時間挺進第一線的無私身影,至今仍讓許多花蓮鄉親感念在心。

【專題報導】創辦人林柏宇:以金融技術轉化公益,讓善意成為新時代的價值語言

今年47歲的創辦人林柏宇,目前投身金融技術整合領域,具備賓夕法尼亞大學華頓商學院背景,並擁有 CFP 認證理財規劃顧問、FRM金融風險管理師、Geprüfter Betriebswirt 認證企業管理師等專業資歷。