Claude Opus 5 is a freak:我親測它能把網頁、3D、報告影片一次做對(也讓人抓狂的地方)

Author:

Claude Opus 5 is a freak,不是在吹牛:它展現出「能自己規劃、能用工具、能跑長流程、還會回頭驗證修正」的能力。更關鍵的是,我在實際測試裡看到它不只產出結果,還會在中途抓到錯誤並修到可用——這種表現讓人很難用一般聊天模型的標準去理解。

我第一次真正被它震到,是用一個很不合理的測試:要它「用單一瀏覽器頁面,做出接近 Windows 11 的介面」,並且要有常見應用、可操作、還要能存檔。我原本以為會變成一堆好看的假畫面,結果它直接把介面機制拆得很細:從拖曳、縮放、吸附(snap)焦點(focus),再一路長出桌面、工作列、開始選單,最後把Word/Excel/PowerPoint 這種級別的互動也做進去。

最怪、也最「freak」的部分在於:它會在渲染後自動檢查錯誤,發現 bug 就回頭修,還會持續測行為,直到我能明確感覺到「真的跑得起來」。我看著它在同一個流程裡,先規劃、再生成、再驗證修補,整個體驗像是在看一個會自我除錯的工程師在遠端趕工。

📝 目錄

Claude Opus 5 為什麼被我說是 freak?:它不是只會回答

Claude Opus 5 is a freak 的核心差異在於:它更像「會做事的系統」,而不是「只會回覆文字」。在我測試中,它能把任務拆成多步,並且在需要時使用不同檔案、不同工具、不同平台的介面,讓輸出從文本一路變成可操作的成果。

我常用的判斷方式是:看它是不是能在任務中維持方向、把細節做完整、並在最後交付可驗證的結果。Opus 5 在「長流程、多步驟」的任務上特別明顯:它會先規劃,再逐段產出組件,最後用驗證流程收尾。這不是偶然的靈感,而是它的工作方式比較接近代理式(agentic)長任務

把它放在我熟悉的語境裡講:我教學時最在意的是「學生是否真的做得出來」。Opus 5 的 freak 在於,它往往真的能做到,而且做完還會回頭檢查。這讓我在面對需要反覆迭代的工作時,感覺它不像是一次性產出,而是能承擔一段工程流程。

我親測的第一波:用單一提示做出類 Windows 11 的可用網頁

我給它的任務很直白:做一個「瀏覽器友善」的 Windows 11 風格頁面,包含常見應用與程式,並且要真的能下載、能運作。它不是只做外觀;它把介面元件應用容器互動行為都做出來。

結果真的讓我停下來看:它先把整體架構規劃好,接著生成桌面、開始選單、工作列等主元件;再把應用逐一塞進去,包括檔案總管、Office(Word/Excel)、媒體播放、Discord、Slack、Spotify、Microsoft Store等。甚至還有一些小遊戲與實用工具風格的呈現。

更誇張的是它能在渲染後進行自動測試:如果在頁面生成過程中出現 bug,它會抓到並修正;接著再找其他錯誤、再測行為。最後我看到的是一個能在 Chrome 這種一般瀏覽器裡運作的版本,包含可編輯、可存檔的互動。

可操作的互動:Word、Excel 的公式與存檔都走得通

我最在意的不是它有沒有做出「看起來像 Word」的畫面,而是有沒有做到真正的互動邏輯。它打開 Word 文件後,我可以輸入文字、套用粗斜體、改字色、調整對齊方式,甚至按下Ctrl S保存。接著我退出再打開,保存內容也真的在。

Excel 的部分同樣讓人安心:我輸入數字後,它能處理公式,例如我寫下=AVERAGE(A1 to A5),它給出正確平均;再寫=SUM(A1 to A5),也能得到正確總和。這代表它不是硬塞假數字,而是做了可用的計算邏輯。

這種「能互動、能保存、能計算」的表現,才是我說它 freak 的原因之一:因為它在把任務做成可驗證的工程成果,而不是只提供展示圖。

它也會卡:PowerPoint 的拖曳能力不夠、部分聊天互動偏硬編

如果你期待它在每個應用都完全像原生軟體,那你會失望。以我測到的 PowerPoint 為例,它確實能生成簡報並打開,但某些操作能力不完整,例如文字方塊的拖曳調整能力不足,功能深度與真實 PowerPoint 仍有落差。

Discord 與 Slack 的互動也有同樣的問題:它能做出介面與訊息視覺效果,甚至模擬有人回覆,但回覆內容並非真正理解你訊息的語意,而是偏向預先設定的行為。換句話說,它在「外觀與流程」上很能打,但在「語意理解後的真對話」仍有明顯限制。

我把這點寫出來,是因為 freak 不代表永遠完美。更合理的解讀是:Opus 5 在工具使用與多步流程上很強,但在需要深度語意推理、或要求高度一致的複雜互動時,仍可能出現可預期的缺口。

第二波震撼:從參考圖生成 3D 動畫,還能比其他模型更貼近

我接著做了更刁鑽的測試:上傳一張幾何辦公場景參考圖,要求它忠實呈現,並生成一個單一 HTML 檔的 3D 動畫場景。這種任務最容易翻車,因為你不只要建模,還要對齊比例、物件關係、光暈與細節一致性。

初版出來後,它確實先給了一個基本場景,但我指出幾個關鍵問題:例如桌椅擺放不對、光暈太多,而且要它「看起來必須像附圖」。結果在後續修正後,整體的對齊與結構明顯更接近原圖。

我仍然看得到不一致,例如有些面板應該貼牆、書架上的書不完全一致、甚至可能出現多一張椅子或漏掉某些人形位置。但相較於我同時測到的其他模型輸出,Opus 5 的版本整體更像、錯得更少,這就是我覺得它「freak」的地方:它能更快逼近你要的真實感。

測試項目 我看到的表現 仍需改進
3D 場景一致性 結構更貼近參考圖 細節仍可能錯位
修正能力 能依回饋做再生成 需要明確指出問題
交付形式 單一 HTML 可跑 複雜場景仍有誤差

第三波:把報告資料找齊、分析、做成影片並完成渲染

接著我做了一個更像「工作委外」的測試:要求它做一支專業簡報影片,對比多家公司的財務與未來展望,並且要它去找到特定季度報告、分析數據、做圖表,還要加入旁白與動畫。

我沒有把報告檔直接貼給它,而是只給任務描述。它後來能夠自行去搜尋報告、整理財務重點、再安裝所需的工具(例如用於動畫的開源素材流程),接著生成旁白、最後把影片渲染出來。這種「從資料取得到成片交付」的完整度,讓我覺得它不只是能寫東西,而是能把流程跑完。

最讓人印象深刻的是它會在生成後做自我驗證:如果發現錯誤,就回頭修正,直到渲染成功。這對反覆做同類型內容的人來說,意義非常大——因為時間常常被卡在「中間出錯、來回修補」的地方。

我對 Claude Opus 5 的結論:freak 的點在「長任務 + 自我驗證 + 工具使用」

總結來說,我仍然站在Claude Opus 5 is a freak這句話上:它的 freak 不是在耍酷,而是在於它更常把任務當成工程來完成。你丟給它的不是「答案」,而是「要做出來的成果」,它就能規劃多步、使用工具、跑長流程,並且在途中用驗證與修正把成功率拉高。

當然,它也會卡在特定深度:例如需要高度一致的複雜互動、或需要真正語意理解的對話品質,仍可能出現硬編或不完整能力。但整體表現讓人難以忽視,尤其是當你追求的是「可用、可操作、可驗證」的輸出。

如果你也正在做需要多步迭代的內容或產品原型,我會建議你用「可檢查的交付標準」去測它:能不能存檔?能不能跑起來?錯誤會不會自動修?只要你用這些標準去看,Opus 5 的 freak 就會越來越明顯。

FAQ

🤖 Claude Opus 5 為什麼會被說是 freak?

因為它不只會回覆,它會把任務跑成可驗證的成果。在我實測中,它能拆解多步流程、使用工具生成可操作介面或成片,並且在生成後進行自我檢查與修正,讓成功率明顯高於只做文字產出的模式。

🧪 它做得到哪些「可驗證」的事情?

它能做出能操作、能保存、能運算的輸出。例如我測到類 Windows 介面裡的 Word 可編輯並保存、Excel 的公式(平均與求和)能得到正確結果;3D 場景也能以單一 HTML 形式交付並可在瀏覽器中呈現。

⚠️ 它有哪些地方不夠完美,還是會讓人抓狂?

它在部分深度互動與語意對話上仍可能硬編或不完整。像 PowerPoint 的拖曳能力不足、Discord/Slack 的回覆可能不真正讀懂你的訊息;而 3D 場景雖更貼近參考圖,仍可能在細節對齊與物件一致性上出現錯漏。

📺 來源影片參考