阿里開源模型 Qwen 3.8 27B 效能驚豔,但預設「想太多」成搞笑災難
Simon Willison 實際測試新開源模型的深度心得,點出模型過度思考(Overthinking)的真實 tradeoff。
• 阿里發布全新開源的 Qwen 3.8 27B 視覺多模態模型,其在 Artificial Analysis 智慧指數中獲得與 GPT-5.6 Luna 相同的 52 分,表現極其亮眼。
• 該模型在獨立基準測試與消費級硬體上展現強大潛力,但官方預設的 xhigh(超高推理強度) 設定會導致模型過度思考,甚至連畫一個簡單的圓形都要花費好幾分鐘進行宏大構思。
「強烈建議忽略該預設值,初次運行時應將 Qwen 3.8 27B 設為低推理甚至關閉推理級別。」 • 雖然預設的過度思考令人啼笑皆非,但適度的推理能力在處理物件邊界框標註與複雜網頁工具開發時,能展現出極高的準確度與一次生成成功率。 • 總體而言,這是一款兼具強大效能與本地運行優勢的優秀模型,只需適當調整推理強度,即可在速度與複雜任務處理之間取得完美平衡。
來源:Simon Willison
閱讀原文 ↗另見:Simon Willison、Hacker News