23款 Gemma 4-E4B 模型評測:下載量最高的最受歡迎模型竟然完全損壞?
針對多個 Gemma 模型進行 abliterations 基準測試與比較,揭露模型真實表現與差異,具備良好開發者參考價值
Category · 分類
針對多個 Gemma 模型進行 abliterations 基準測試與比較,揭露模型真實表現與差異,具備良好開發者參考價值
Simon Willison 引用 Boris Cherny 對 Opus 5 抗提示詞注入(prompt injection)的系統卡片觀察,具備高信號實作參考價值
Together AI 針對 Kimi K3 與 Claude Fable 5 的 DeepSWE 評測與性價比分析,具備具體數據
用戶分享使用 Kimi K3 進行複雜任務的失敗經驗(生成 Draw.io 圖表),並與 Deepseek V4 Pro 比較,真實揭示了模型在特定場景下的侷限性和成本問題,屬於寶貴的踩坑分享。
用戶分享 Kimi K3 在重度編碼任務上的實測經驗,強調其在複雜重構、長上下文保持和自我修正能力,提供了模型在真實開發場景下的深度評估。
比較 Kimi K3 和 Fable 5 在代理任務上的表現,並提出混合使用 K3 和 Fable 的 SoTA 方案,對開發者進行模型選擇和成本優化有實際指導意義。
Claude Sonnet 4.5 被宣稱為最佳編碼模型,對建構複雜代理和電腦使用有優勢,是值得關注的模型發布。
Hacker News 關於 Kimi K3 的大量討論,包含其開源、性能和價格分析,是重要的模型發布資訊,且有多方觀點。
美團 LongCat-2.0 模型開源,專為 Agentic Coding 設計,支援長上下文並在國產算力上進行訓練和推理,是重要的模型發布。
Simon Willison 深度解析 GPT-5.6 系列模型,包含定價、知識截斷日期等實用資訊,對開發者和使用者選擇和評估模型有參考價值。
高度評價 MiMo v2.5 模型,認為其在 30b-400b 之間填補了效能空白,甚至比雲端服務更快,並附帶了硬體配置和測試結果,是對特定模型在本地部署性能的深度實戰評估。
Mistral AI 發布 Robostral Navigate,一個 8B 模型,僅用單一 RGB 攝像頭即可實現機器人自主導航,性能優越且效率高,是機器人 AI 的重要突破。
Anthropic 發布 Claude Sonnet 5,強調其代理(agentic)能力,包括規劃、使用工具、自主運行,並指出 Sonnet 系列模型在代理 AI 時代的開創性。
介紹 Ornith-1.0 開源模型,特別是其在 coding 方面的能力,對於尋找或評估新模型以用於實戰的開發者有參考價值。
OpenAI 預覽下一代模型 GPT-5.6 Sol,強調在編碼、科學和網絡安全方面的能力增強,並提及先進的安全堆疊。這是關於新模型發布的重要資訊,雖然沒有直接的實作教學,但對開發者而言是關鍵的技術動態。
Hacker News 轉發 OpenAI GPT-5.6 Sol 的預覽,並包含系統卡連結,是新模型發布的重要資訊。
TLDR AI 摘要了 GPT-5.6、Claude Code 的 artifacts 和 Perplexity 的 Brain memory,涵蓋了模型和工具的最新動態,對了解業界發展有幫助。
Baseten 評估了多個開源 LLM,並針對不同場景(全能、編碼、長文本、企業、成本/速度)給出了推薦,提供了非常實用的模型選擇指南。
介紹了 GLM-5.2 這個具有 753B 參數的模型,並指出其為文本輸入模型,其開源發布對研究者和開發者有實際意義。
介紹 MiniMax M3 模型,強調其長上下文、多模態能力與價格優勢,並包含架構細節與應用場景,對使用新模型的開發者有直接幫助。
Simon Willison 介紹 DiffusionGemma,這是 Gemma 模型家族中的新成員,強調其 4x 文本生成速度的提升,對研究者和開發者有價值。
One Useful Thing 評論 Claude Fable 的使用體驗,從實戰者角度分享對新模型的觀察。
Simon Willison 分享了他對 Claude Fable 5 的初步印象,認為它非常強大但同時也很慢且昂貴,討論了如何找到它無法處理的任務,這是獨立作者深度實作心得。
分享將「質疑/反對」的 reasoning doctrine 濃縮到 7B 模型,讓其能推拒不合理請求,是 Prompt Engineering 的進階應用,改變了傳統的服從性調校。