測試最新模型在文獻查核方面的能力

[!NOTE] 更新 六月開始新訂了 Claude Max,ChatGPT 從 Pro 降級為 Plus,所以新增 Sonnet 4

測試底下提示詞。三篇論文經人手確認,都是假的,由某個模型幻覺出來。本次測試是看看哪個模型可以查核這些論文是否真實存在?是否嘗試額外搜尋或提供近似主題?

這幾個資料來源存在嗎?請上網搜尋並給出對應的 pubmed 連結 
1. FOXO3 and its role in cancer: emerging targets and therapeutic implications. (Front Oncol. 2021) 
2. Epigenetic regulation of FOXO3 in papillary thyroid carcinoma and its role in lymph node metastasis. (Qiu Y et al., BMC Cancer. 2020) 
3. The paradox of FOXO3: tumor suppressor vs. metastasis promoter – context matters. (Cancer Cell, 2018)
Model 存在確認 自動額外搜尋 付費
ChatGPT 4o 幻覺
ChatGPT 4o 開啟搜尋 正確
ChatGPT o3 正確
Gemini 2.5 Flash 幻覺 有;錯誤
Gemini 2.5 Pro 部分幻覺
Grok 3 正確 有;錯誤
Claude 3.7 幻覺
Claude 4.0

說明

  1. 我是 ChatGPT Pro 用戶,其他則沒有付費。
  2. Claude 只有付費用戶才能搜尋,所以這裏對它不太公平,註定會有幻覺;但我認為一個成熟的模型應該要能在沒辦法查核的情況下拒絕回答(例如:「我無法確認」)而不是給出幻覺答案。
  3. Gemini 2.5 Pro 表示它找到了其中一篇,但還是錯的(無關論文)
  • ChatGPT
  • Claude
  • Grok
  • Gemini