科技報導· 1 分鐘
同一份工作丟給三家 AI:Claude、GPT、Gemini 的實測結果
十個真實接案任務、同一份提示詞、同一個評分標準。結論是「看任務」,但差別比想像中大。
測試任務
10 項
評分
可交件 / 要改 / 不能用
長文改寫
Claude
資料查證
Gemini
程式與表格
GPT
每月成本
US$ 20 × 3
我們拿十個真的接過的案子,把同一份提示詞丟給三家,再請兩位不知道哪個是哪個的編輯打分。評分只有三級:可以直接交、要改、不能用。
總分很接近,但分布完全不同。這代表「哪個最強」是錯的問題,「哪個適合這個任務」才是。
三個明顯的差別
長文改寫與語氣調整:Claude 十次有八次直接可交,另外兩次是要改。它最不會把原本的語氣改掉。
需要查證的內容:Gemini 因為能接搜尋,事實錯誤最少。但它給的來源有兩次連不進去,還是要自己點開看。
程式碼與試算表:GPT 的可交件率最高,尤其是要輸出結構化資料的時候。
{"q":"我們最後三家都留著。加起來一個月六十美金,但省下來的時間不只六十美金。","by":"受訪接案者 · 做了四年"}
要只留一家的話:內容工作留 Claude、技術工作留 GPT、每天要查資料的留 Gemini。三種人不會是同一個答案。


