測試最新模型在文獻查核方面的能力
[!NOTE] 更新 六月開始新訂了 Claude Max,ChatGPT 從 Pro 降級為 Plus,所以新增 Sonnet 4
測試底下提示詞。三篇論文經人手確認,都是假的,由某個模型幻覺出來。本次測試是看看哪個模型可以查核這些論文是否真實存在?是否嘗試額外搜尋或提供近似主題?
這幾個資料來源存在嗎?請上網搜尋並給出對應的 pubmed 連結
1. FOXO3 and its role in cancer: emerging targets and therapeutic implications. (Front Oncol. 2021)
2. Epigenetic regulation of FOXO3 in papillary thyroid carcinoma and its role in lymph node metastasis. (Qiu Y et al., BMC Cancer. 2020)
3. The paradox of FOXO3: tumor suppressor vs. metastasis promoter – context matters. (Cancer Cell, 2018)
| Model | 存在確認 | 自動額外搜尋 | 付費 |
|---|---|---|---|
| ChatGPT 4o | 幻覺 | 無 | 有 |
| ChatGPT 4o 開啟搜尋 | 正確 | 無 | 有 |
| ChatGPT o3 | 正確 | 無 | 有 |
| Gemini 2.5 Flash | 幻覺 | 有;錯誤 | 無 |
| Gemini 2.5 Pro | 部分幻覺 | 無 | 無 |
| Grok 3 | 正確 | 有;錯誤 | 無 |
| Claude 3.7 | 幻覺 | 無 | 無 |
| Claude 4.0 | 無 | 有 | 有 |
說明
- 我是 ChatGPT Pro 用戶,其他則沒有付費。
- Claude 只有付費用戶才能搜尋,所以這裏對它不太公平,註定會有幻覺;但我認為一個成熟的模型應該要能在沒辦法查核的情況下拒絕回答(例如:「我無法確認」)而不是給出幻覺答案。
- Gemini 2.5 Pro 表示它找到了其中一篇,但還是錯的(無關論文)