Claude Opus 5 is a freak,不是在吹牛:它展現出「能自己規劃、能用工具、能跑長流程、還會回頭驗證修正」的能力。更關鍵的是,我在實際測試裡看到它不只產出結果,還會在中途抓到錯誤並修到可用——這種表現讓人很難用一般聊天模型的標準去理解。
我第一次真正被它震到,是用一個很不合理的測試:要它「用單一瀏覽器頁面,做出接近 Windows 11 的介面」,並且要有常見應用、可操作、還要能存檔。我原本以為會變成一堆好看的假畫面,結果它直接把介面機制拆得很細:從拖曳、縮放、吸附(snap)到焦點(focus),再一路長出桌面、工作列、開始選單,最後把Word/Excel/PowerPoint 這種級別的互動也做進去。
最怪、也最「freak」的部分在於:它會在渲染後自動檢查錯誤,發現 bug 就回頭修,還會持續測行為,直到我能明確感覺到「真的跑得起來」。我看著它在同一個流程裡,先規劃、再生成、再驗證修補,整個體驗像是在看一個會自我除錯的工程師在遠端趕工。
📝 目錄
- Claude Opus 5 為什麼被我說是 freak?:它不是只會回答
- 我親測的第一波:用單一提示做出類 Windows 11 的可用網頁
- 可操作的互動:Word、Excel 的公式與存檔都走得通
- 它也會卡:PowerPoint 的拖曳能力不夠、部分聊天互動偏硬編
- 第二波震撼:從參考圖生成 3D 動畫,還能比其他模型更貼近
- 第三波:把報告資料找齊、分析、做成影片並完成渲染
- 我對 Claude Opus 5 的結論:freak 的點在「長任務 + 自我驗證 + 工具使用」
- FAQ
- 🤖 Claude Opus 5 為什麼會被說是 freak?
- 🧪 它做得到哪些「可驗證」的事情?
- ⚠️ 它有哪些地方不夠完美,還是會讓人抓狂?
Claude Opus 5 為什麼被我說是 freak?:它不是只會回答
Claude Opus 5 is a freak 的核心差異在於:它更像「會做事的系統」,而不是「只會回覆文字」。在我測試中,它能把任務拆成多步,並且在需要時使用不同檔案、不同工具、不同平台的介面,讓輸出從文本一路變成可操作的成果。
我常用的判斷方式是:看它是不是能在任務中維持方向、把細節做完整、並在最後交付可驗證的結果。Opus 5 在「長流程、多步驟」的任務上特別明顯:它會先規劃,再逐段產出組件,最後用驗證流程收尾。這不是偶然的靈感,而是它的工作方式比較接近代理式(agentic)長任務。
把它放在我熟悉的語境裡講:我教學時最在意的是「學生是否真的做得出來」。Opus 5 的 freak 在於,它往往真的能做到,而且做完還會回頭檢查。這讓我在面對需要反覆迭代的工作時,感覺它不像是一次性產出,而是能承擔一段工程流程。
我親測的第一波:用單一提示做出類 Windows 11 的可用網頁
我給它的任務很直白:做一個「瀏覽器友善」的 Windows 11 風格頁面,包含常見應用與程式,並且要真的能下載、能運作。它不是只做外觀;它把介面元件、應用容器、互動行為都做出來。
結果真的讓我停下來看:它先把整體架構規劃好,接著生成桌面、開始選單、工作列等主元件;再把應用逐一塞進去,包括檔案總管、Office(Word/Excel)、媒體播放、Discord、Slack、Spotify、Microsoft Store等。甚至還有一些小遊戲與實用工具風格的呈現。
更誇張的是它能在渲染後進行自動測試:如果在頁面生成過程中出現 bug,它會抓到並修正;接著再找其他錯誤、再測行為。最後我看到的是一個能在 Chrome 這種一般瀏覽器裡運作的版本,包含可編輯、可存檔的互動。
可操作的互動:Word、Excel 的公式與存檔都走得通
我最在意的不是它有沒有做出「看起來像 Word」的畫面,而是有沒有做到真正的互動邏輯。它打開 Word 文件後,我可以輸入文字、套用粗斜體、改字色、調整對齊方式,甚至按下Ctrl S保存。接著我退出再打開,保存內容也真的在。
Excel 的部分同樣讓人安心:我輸入數字後,它能處理公式,例如我寫下=AVERAGE(A1 to A5),它給出正確平均;再寫=SUM(A1 to A5),也能得到正確總和。這代表它不是硬塞假數字,而是做了可用的計算邏輯。
這種「能互動、能保存、能計算」的表現,才是我說它 freak 的原因之一:因為它在把任務做成可驗證的工程成果,而不是只提供展示圖。
它也會卡:PowerPoint 的拖曳能力不夠、部分聊天互動偏硬編
如果你期待它在每個應用都完全像原生軟體,那你會失望。以我測到的 PowerPoint 為例,它確實能生成簡報並打開,但某些操作能力不完整,例如文字方塊的拖曳調整能力不足,功能深度與真實 PowerPoint 仍有落差。
Discord 與 Slack 的互動也有同樣的問題:它能做出介面與訊息視覺效果,甚至模擬有人回覆,但回覆內容並非真正理解你訊息的語意,而是偏向預先設定的行為。換句話說,它在「外觀與流程」上很能打,但在「語意理解後的真對話」仍有明顯限制。
我把這點寫出來,是因為 freak 不代表永遠完美。更合理的解讀是:Opus 5 在工具使用與多步流程上很強,但在需要深度語意推理、或要求高度一致的複雜互動時,仍可能出現可預期的缺口。
第二波震撼:從參考圖生成 3D 動畫,還能比其他模型更貼近
我接著做了更刁鑽的測試:上傳一張幾何辦公場景參考圖,要求它忠實呈現,並生成一個單一 HTML 檔的 3D 動畫場景。這種任務最容易翻車,因為你不只要建模,還要對齊比例、物件關係、光暈與細節一致性。
初版出來後,它確實先給了一個基本場景,但我指出幾個關鍵問題:例如桌椅擺放不對、光暈太多,而且要它「看起來必須像附圖」。結果在後續修正後,整體的對齊與結構明顯更接近原圖。
我仍然看得到不一致,例如有些面板應該貼牆、書架上的書不完全一致、甚至可能出現多一張椅子或漏掉某些人形位置。但相較於我同時測到的其他模型輸出,Opus 5 的版本整體更像、錯得更少,這就是我覺得它「freak」的地方:它能更快逼近你要的真實感。
| 測試項目 | 我看到的表現 | 仍需改進 |
|---|---|---|
| 3D 場景一致性 | 結構更貼近參考圖 | 細節仍可能錯位 |
| 修正能力 | 能依回饋做再生成 | 需要明確指出問題 |
| 交付形式 | 單一 HTML 可跑 | 複雜場景仍有誤差 |
第三波:把報告資料找齊、分析、做成影片並完成渲染
接著我做了一個更像「工作委外」的測試:要求它做一支專業簡報影片,對比多家公司的財務與未來展望,並且要它去找到特定季度報告、分析數據、做圖表,還要加入旁白與動畫。
我沒有把報告檔直接貼給它,而是只給任務描述。它後來能夠自行去搜尋報告、整理財務重點、再安裝所需的工具(例如用於動畫的開源素材流程),接著生成旁白、最後把影片渲染出來。這種「從資料取得到成片交付」的完整度,讓我覺得它不只是能寫東西,而是能把流程跑完。
最讓人印象深刻的是它會在生成後做自我驗證:如果發現錯誤,就回頭修正,直到渲染成功。這對反覆做同類型內容的人來說,意義非常大——因為時間常常被卡在「中間出錯、來回修補」的地方。
我對 Claude Opus 5 的結論:freak 的點在「長任務 + 自我驗證 + 工具使用」
總結來說,我仍然站在Claude Opus 5 is a freak這句話上:它的 freak 不是在耍酷,而是在於它更常把任務當成工程來完成。你丟給它的不是「答案」,而是「要做出來的成果」,它就能規劃多步、使用工具、跑長流程,並且在途中用驗證與修正把成功率拉高。
當然,它也會卡在特定深度:例如需要高度一致的複雜互動、或需要真正語意理解的對話品質,仍可能出現硬編或不完整能力。但整體表現讓人難以忽視,尤其是當你追求的是「可用、可操作、可驗證」的輸出。
如果你也正在做需要多步迭代的內容或產品原型,我會建議你用「可檢查的交付標準」去測它:能不能存檔?能不能跑起來?錯誤會不會自動修?只要你用這些標準去看,Opus 5 的 freak 就會越來越明顯。
FAQ
🤖 Claude Opus 5 為什麼會被說是 freak?
因為它不只會回覆,它會把任務跑成可驗證的成果。在我實測中,它能拆解多步流程、使用工具生成可操作介面或成片,並且在生成後進行自我檢查與修正,讓成功率明顯高於只做文字產出的模式。
🧪 它做得到哪些「可驗證」的事情?
它能做出能操作、能保存、能運算的輸出。例如我測到類 Windows 介面裡的 Word 可編輯並保存、Excel 的公式(平均與求和)能得到正確結果;3D 場景也能以單一 HTML 形式交付並可在瀏覽器中呈現。
⚠️ 它有哪些地方不夠完美,還是會讓人抓狂?
它在部分深度互動與語意對話上仍可能硬編或不完整。像 PowerPoint 的拖曳能力不足、Discord/Slack 的回覆可能不真正讀懂你的訊息;而 3D 場景雖更貼近參考圖,仍可能在細節對齊與物件一致性上出現錯漏。
🔗 延伸閱讀與參考資料
📺 來源影片參考

我是親職講師和老師,長年觀察發現,孩子們花大量時間在學校和補習班,卻沒真正享受生活,更別提快樂地玩耍。父母多半照著自己求學的模式,希望孩子也能如此,但孩子們往往抗拒,家長無策,心中惶恐。
我的好友彼得先生常提醒,生命應該是多面向的,包含家庭、工作、社交、自然、靈性等,如果任何一方面失衡,其他再努力也無法達成人生的圓滿。這就是水桶理論的精髓。如今我已退休,生活不再步步為營,決定回饋多年來彼得先生的輔導。我希望透過生活小故事和有趣介紹,幫助家長與孩子點亮心中想法,過上有意義、有目標的生活。


