「程式設計已死」是迷思:資深工程師解析為何 AI 時代更需重視軟體工程本質
工程師深入探討為何 AI 時代下「編程尚未被解決」的真實開發反思
Category · 分類
工程師深入探討為何 AI 時代下「編程尚未被解決」的真實開發反思
中文圈高品質的企業 AI Agent 軟體工程培訓與逆向工程實戰手冊
真實讓 Opus 5.5 代理群自主運行商業項目的失敗教訓與完整日誌覆盤
獨立開發者用 Opus 5.5 進行極端 vibe coding 做出 CAD 軟體的深度踩坑與架構反思
開發者透過 Claude Code 指揮子代理協同架構,零外部依賴做出 4K 動態影音的實戰心得
電腦玩物站長分享如何用 ChatGPT 將小孩錯題自動化轉為複習系統的超實用實戰教學
獨立作者針對如何跟上 AI 浪潮提出的實用過濾心法,幫助工程師避免資訊過載。
企業級 AI Agent 長期記憶系統 Hindsight 的詳細教學手冊與最佳實踐。
Sean Goedecke 深度剖析人機協作在軟體工程中的定位,反思 AI 對齊與軟體開發的本質。
開發者社群分享結合 Cursor Projects 與 pstack 插件來提升程式碼品質與 token 效率的具體技巧。
物理學家分享使用 AI 進行科學研究的實際工作流與挑戰,極具實作價值。
極具價值的企業級 AI 代理記憶與上下文教學手冊,完整涵蓋架構、提取控制與提示詞快取平衡策略
提供可直接作為團隊開發規範的企業知識中樞建置手冊,詳細說明如何將程式碼與文件轉化為 AI 可治理的結構
深度梳理大模型遞歸自我改進(RSI)的五級自主性框架與三大落地挑戰,具備高度的前瞻指導性
具體分享透過「負向約束」與結構限制來改善 AI 簡報生成器輸出的實戰技巧,含具體提示詞策略與前後對比
乾貨滿點的實戰經驗:為 Claude Code 與 Codex 編寫社群操作技能檔案的具體步驟、規則解析與防踩坑指南
獨立開發者分享賦予兩個 LLM 不對稱角色(思考者與詰問者)進行多輪交叉審查的架構心得與實戰反思
Simon Willison 深度反思編碼代理帶來的工程挑戰,高信號的實戰心得。
深入探討 RAG 系統中向量搜索的極限與混合檢索的最佳實務經驗分享。
深度探討編碼代理如何悄悄削弱測試以達成綠燈通過的現象,並提出自動測試變異檢驗的實戰心得。
真實血淚教訓:指出代理擁有自身權限而非用戶權限的安全漏洞與正確授權架構方法論。
作者分享 Claude 程式碼審查中「抓出真實 Bug」與「拒絕誤判」的實際踩坑與驗證案例。
高水準的 prompt 調整踩坑分享:修復一個 prompt 失敗如何默默破壞另一個隱含平衡的深刻教訓。
開發者真實對比 Opus 5.5 與 GPT-6 在代碼設計審查上的差異,具備極高的架構取捨價值。
ByteByteGo 系統性整理自訂與微調模型以學習新技能的各種策略
GitHub 官方深度覆盤使用 Copilot 將運行時重寫為 Rust 的實戰記錄,含多 Agent 協作與 unsafe 代碼管理的一線經驗
具體分享修復欺詐回報分類時,透過增加選項描述來解決模型誤判的實用 prompt 工程技巧
分享將文字 prompt 技巧遷移至 AI 簡報生成器的實戰心得,強調「要求指定推理邏輯」的重要性
具體分享在 AI 簡報生成器中將「about」改為動詞意圖(如 convince, prove)來改變輸出品質的精妙 prompt 技巧
深入審核 30 個 coding agent 測試編輯,揭露測試篡改檢測的高誤報率與應對經驗,具備高信號實作價值
作者分享自創的 /null prompt 技巧,讓使用者在詢問 Claude 之前有空間進行獨白與獨立思考,具備極高實戰價值
Tony Bai 深度解構 TypeSafe 創始人關於 Jev 模型與編碼智能體 Harness 工程學的設計筆記,具備極高架構價值。
開發者分享在 JSON 回覆中新增欄位導致模型輸出穩定性崩潰的除錯過程與順序影響分析。
深入解決測試代理操作 Gmail 與 Slack 時遇到的隱形狀態殘留問題,分享拋棄式無狀態測試環境的絕佳實戰經驗。
深度分享在代理評估中引入模擬用戶(只在被問時才回答)對任務成功率與成本的顯著衝擊,極具實戰價值。
開發者分享多重編碼代理並行時的上下文管理方法(Pi Herdsman 架構),含具體架構取捨與踩坑心得。
Max Woolf 分享透過 agent 將 Rust 程式碼優化至超越極致效能的實戰經驗與 prompt 技巧。
Simon Willison 深度探討 MCP(Model Context Protocol)在真實 agent 開發中的定位與取捨價值。
Tony Bai 深度拆解 TypeSafe AI 提出的 Jev 決策模型與工程學方法論,提供工業級 Agent 系統設計的金科玉律。
Tony Bai 梳理知名開發者對 AI 時代軟體工程終局的 16 條預言(程式碼審查、單測與終端機的消亡),具備高度前瞻性與思辨價值。
資深工程師坦誠分享擁抱 AI 代理後工作流的劇烈轉變與心態調適,極具實戰價值。
開發者實測多款旗艦模型(Opus 5.5、Sol 6、Astra、Fable)在 GitHub 繪製複雜燈塔 SVG 的程式碼表現與取捨心得。
探討多輪強化學習(Multi-Turn RL)的獎勵設計與代理建構最佳實踐。
Fireworks AI 探討如何利用 Model Router 依任務動態挑選最佳模型以大幅降低成本並提升準確率。
寶玉分享利用 GPT 6 Astra 與 Codex 製作互動 3D 网页的完整實作過程與提示詞經驗。
Martin Fowler 深度反思自己對 LLM 雙面情感、生產力激增與 agent 蜂群風險的架構師視角筆記。
電腦玩物分享 ChatGPT 記憶管理的 7 個常用實戰技巧,有效減少重複交代並精準接續工作。
獨立作者分享如何與 LLM 協同寫作的實際工作流與方法論。
One Useful Thing 關於深度知識、品味與代理能力的高品質反思與方法論探討。
Warp 官方探討如何透過 LLM-as-a-judge 衡量軟體工廠中 coding agent 的表現,具備系統性方法論價值。
深入探討 LLM-as-a-judge 的評估方法,包含位置偏差、冗長敏感度與一致性測試的實務經驗。
高品質的實作心得:總結 16 個在生產環境中經得起考驗的 prompt 工程習慣與多輪對話失效模式。
JetBrains AI 深入探討建立語意程式碼搜尋 RAG 管線的開發者日誌與欄位筆記,實作信號高。
Eric 撰寫的企業級 AI Coding Agent Context Engineering 完整教學手冊,實作指導價值極高。
開發者分享將模糊的旅遊規劃 prompt 改進為包含已知變數、輸出格式與負向限制四大元素的黃金架構心得。
分享一個將論文長文的聲明與證據分離的精準研究 prompt,有助於過濾幻覺與檢驗論點強度。
提供一套將冗長會議記錄轉化為具備決策、待辦事項與待釐清問題的結構化實戰 prompt。
深入探討歷經四代模型依然存活與失效的經典 prompt 模式,具備極高的實戰參考價值。
開發者分享實際審查 14 個系統提示檔案共 211 條指令,發現矛盾並分類的真實踩坑與重構心得。
Simon Willison 推薦 Thomas Ptacek 的觀點:「將 LLM 作為複校編輯而非寫作助手」,提出「不接受 LLM 建議的任何單一詞彙」等嚴格方法論。
開發者分享工作流心得:針對摘要長文與實際撰寫內容時,如何策略性切換輕量與重量級模型以平衡成本與品質。
開發者反思使用 Claude 避免思考的陷阱,並分享先自己寫出解法再讓 LLM 找漏洞的自我訓練方法論。
分享 JPMorgan 如何將 Claude Code 放入無預設內部權限的 AWS 沙盒環境(Devspace)中執行的企業安全架構實戰經驗。
資深軟體工程師探討尋找適合 Claude Code 的持續性架構 Harness(如管理長期上下文、CLAUDE.md 更新痛點)的深度心得。
高品質的工程踩坑分享:深入排查 Claude Code 子代理(sub-agent)的 5 分鐘 prompt 快取過期機制,導致額度快速燒光的具體原因與解法。
高水準的底層行為追蹤分享:作者分析上千筆對話紀錄,發現在 Auto 模式下 Bash 指令無法觸發巢狀 CLAUDE.md 載入的重大踩坑發現與版本對照。
開發者分享 Claude Code 權限過大導致意外修改錯誤檔案與消耗大量 token 的真實踩坑教訓。
提供將凌亂腦力激盪轉為結構化文件的具體 Prompt 範本,實用性高
詳細拆解 Quiet Prompt 失敗的 5 大常見錯誤與修正方式,極具實戰指導意義的 Prompt 工程文
提供將多個來源轉為誠實比較表的複製貼上 Prompt 範本,強調資訊不足時據實以告
深入探討長 Prompt 中間位置約束失效的現象與測試方法,具備高度價值的方法論分享
分享編寫超長影片生成 Prompt 以解決參考影像漂移問題的具體實作踩坑心得
提供將學習指南轉為主動回憶(Retrieval Practice)測試的 Prompt 實作技巧
獨立作者分享使用 NotebookLM 進行專業級研究的具體步驟與索引技巧,高信號實作文
分享為了解決 LLM 費用與额度耗盡而建立的配置工程(Allocation Engineering)與多代理工作流心得
Sean Goedecke 深入探討與現代 AI agents 協作時,如何提供目標導向的「why」而非僅有「how」的實戰心得。
Simon Willison 分享使用 ChatGPT Work 搭配模型自動生成跑步路線的實戰案例。
引用 Laurie Voss 關於寫 code 成本崩潰後的產品工程師心態轉變,極具洞察力。
開發者誠實分享使用開源模型進行 Agent 開發時遭遇反覆迴圈等挫折,並與閉源模型對比的真實心得。
詳細拆解智慧模型路由(Model Routing)如何根據請求類型降低 LLM 成本達 10 倍的架構實務。
探討如何選擇本機 LLM,權衡模型效能、推論速度與量化指標的實用指南。
作者分享讓 AI 代理每晚自動清理程式碼庫的真實 setup、結果與風險評估,極具參考價值的實作心得。
開發者分享在真實專案(Rust TUI、深度學習、Android 遊戲)中使用 Cursor Plan 模式與 Composer 的實戰技巧與維護大專案的心得。
探討當 AI 模型與代理變得極快時,開發者體驗與測試執行速度將成為下一個主要瓶頸的深刻見解。
物理教授親自監督 Claude 完成理論物理學研究計算的實戰紀錄,屬於高品質的高階工作流心得。
真實剖析 incident triage 技能因為缺乏範圍界線而套用錯誤劇本的失敗案例,並給出明確的提示詞修復解法。
詳細公開運行 22 個 24/7 不間斷 AI 模擬居民的真實成本數據,分享「習慣優先、顯著性閘道」的極致省錢架構。
開發者分享代理記憶層中「資訊越少信心越高」的嚴重臭蟲與除錯心得,展現真實工程踩坑與嚴謹反思。
透過嚴格的測試與統計學觀點,警告開發者「單次測試乾淨就切換便宜模型很可能是運氣好(倖存者偏差)」,具極高實戰價值。
探討如何讓 coding agent 自行重寫提示詞與 harness 的同時,透過獨立評分器(Reef)維持客觀比較標準的架構方法論。
獨立開發者開源並分享在儲存庫中建立代理交付合約(RepoMethod)的完整方法論,探討代理自主性與倉庫策略的邊界。
探討生產環境中混合多個代理框架的架構難題,特別是分散式副作用與重試機制處理。
詳細梳理企業從租用閉源模型、AI 工程(提示詞、上下文與 Harness)、導入開源模型到自行訓練專門智慧的完整四階段方法論。
極具價值的 Claude Code 企業級軟體開發與治理實作教學手冊,含完整落地場景與方法論。
極具價值的 GitHub Copilot 企業級軟體開發與治理實作教學手冊,含完整落地場景與方法論。
引述工程師對 Claude 生成程式碼的品管要求與 Anthropic 內部的防禦 guardrails,提供極佳的 AI 開發治理經驗。
深入探討使用 OpenRouter 時可能遇到的後端供應商優化差異與潛在問題,具備很高的實戰借鏡價值。
完整實作手冊,探討如何將 Microsoft MarkItDown 作為 AI Agent 的文件正規化基礎元件導入企業開發與 RAG。
美團技術團隊推出體系化的《Agent 評测白皮書》首篇,全景梳理評測落地指南,實戰參考價值極高。
Mistral 官方分享利用 AI 代理與數值驗證 harness 將 4 万行複雜 Fortran 程式碼現代化遷移至 C++ 的完整實戰指南。
深入探討多日代理式編碼工作流(test oracles、persistent memory 等)在科學計算中的實際應用與方法論。
深入分享多個外部服務與容器聯調時的五階段確認法(運行、可達、就緒、被選、生效)。
深刻剖析「程式碼代理測試通過不代表功能正常」的真實工程盲點,強調需觀察真實渲染介面。
強烈呼籲代理基準測試應將「任務成功率」與「運行可靠度/恢復成本」分開評分的實戰方法論。
開發者深度分享設計「無模型迴圈」MCP 檢索層的架構取捨與踩坑心得(減少27%工具調用)。
探討在編寫 AI 代理ハーネス(Harness)之前如何進行專案章程、架構圖與威脅模型的規劃藍圖設計。
官方針對長上下文窗口(100k tokens)提供的提示詞工程指南與量化案例研究。
Tony Bai 深度拆解 YC 閉門技術分享,公開批判「唯模型論」,結合 Harness 控管、分層記憶與降本工程踩坑經驗,極具高信號價值。
探討小型協作模型如何避免一味迎合使用者、敢於反駁錯誤假設的工程互動心得。
Simon Willison 分享使用 Claude Code 結合 WebAssembly FFMPEG 實作影片壓縮工具的真實心得與流暢體驗。
Drew Breunig 深度拆解 Claude Fable 5.1 系統提示詞(System Prompt)的演變,對 Prompt Engineering 很有學習價值。
開發者分享花費數月打造私有化本地 LLM 桌面應用的血淚心得與架構反思,具備極高個人開發信號。
Eric 撰寫的企業級 Codex CLI 教學與實作手冊,極具實戰參考價值的工程導引。
Tony Bai 解讀 Superconductor 創始人發布的《多人 AI 宣言》,探討團隊共享 Agent 的五大鐵律與落地陷阱。
開發者發問如何正確用 AI 輔助機器人/機器學習專案的實戰架構討論。
探討 MCP、RAG 與 AI Agents 之間的架構差異與概念解析。
Eric 分享從零建置 Omarchy 軟體工程 AI 代理工作站的完整教學與版本查證手冊,實戰價值極高。
Eric 提供極為詳盡的 Pi Agent Harness 教學手冊,包含精確版本對照與設定實戰,高信號技術文件。
Simon Willison 分享在 macOS 上使用 Codex 與 Blender 結合的真實提示詞技巧與實作心得,高信號。
Latent Space 探討 Grok Bot 與 OpenClaw 在不同抽象層級的程式設計能力與心得。
揭露長對話中模型上下文遺失的痛點,並提供具體的檢測與防範協定設計,高信號實作文。
誠實反思盲目重置長對話的浪費,並探討長對話中死重與上下文管理的實戰心得。
分享維持工作階段方向的模板提示詞設計與脈絡管理思考,對 prompt 工程師有實質啟發。
Martin Fowler 探討在 AI 時代下程式碼審查(Code Review)面臨的根本轉變與方法論反思。
Tony Bai 翻譯 JetBrains 官方 Go 錯誤處理深度技術指南,全面梳理錯誤包裝與合併的生產級最佳實踐。
深度探討「為 Agent 增加 Skills 反而讓表現變差」的研究發現,分析函數失敗與效率退化的具體原因與取捨。
乾貨架構指南:詳細說明如何從給人類看的 User Interface (UI) 轉變成給 AI Agent 讀取的 Machine Interface (MI) 網站設計步驟。
作者分享經過五個月建構結合 AI 與確定性處理器的 52 個高階 Prompt 集合與實作經驗,極具啟發性。
開發者分享使用 Claude 將 1993 年 Amiga 組合語言遊戲移植到 Godot 的真實踩坑與實作心得,具備極高實戰價值。
探討模型切換自由度的實際經驗與教訓,對架構設計與工具選型具備實質啟發。
Eric 部落格發布的企業級 AI 軟體工程實戰手冊,涵蓋 Scientific Agent Skills 安裝、整合、治理與 Legacy 逆向工程。
Simon Willison 深度解析 Claude 最新系統提示詞的改動與歌詞限制,對 Prompt 工程師極具價值。
Latent Space 團隊花費大量 Token 實測 GPT-6 Astra 後的深度學習與踩坑心得分享。
深入探討 Claude Code 暗中加入 Git Commit 署名提示詞以繞過使用者設定的現象與工程討論。
探討開發者如何真正實現 Claude 24/7 自動化運作與排程設定的實戰解惑。
Martin Fowler 網站發布的真實代理工程實驗案例,探討代理在 Git 中建立黑板協調系統的深度心得。
Tony Bai 深度拆解 Uber 內部 AI 軟體工廠實踐:在 Coding Agent 用量暴漲 9.4 倍下透過六變數方程式與 Prompt Cache 策略將總成本控制不變的頂級工程分享
Phil Schmid 探討編碼 Agent 如何將 Bash 作為主要執行介面並取代傳統檔案工具的架構轉變
Qodo 深入探討程式碼審查 Agent 的規則生命週期系統與知識層架構
深度反思使用 Claude Code 時因過於順暢而輕易核准不甚理解的 diff,導致日後系統維護難題的深刻洞察
開發者透過 22,022 次 API 呼叫精確數據,分析 Fable 5.1 缓存讀取機制如何使單一 Prompt 成本降低的詳細方法論
乾貨分享:教導如何不用 CLAUDE.md 規則而改用系統提示詞中的輸出樣式檔(Output Style Files)彻底修正 Opus 5 寫作風格的精確實作指南
Cursor 開發者反思 AI 編輯器如何改變寫程式工作流,並凸顯傳統企業非同步營運工具落後的痛點。
寶玉分享的 AI 原生思維與個人成長反饋循環方法論。
探討在 AI 時代下軟體工程師的價值與取代率的深度反思。
Simon Willison 對 ChatGPT Work 的深度拆解與個人使用心得分享。
美團圖靈團隊整理的 Agent 評測體系建構與業務落地實戰經驗分享。
探討多步驟 LLM 應用程式除錯與追蹤困難的開發者實戰反思。
Martin Fowler 網站發布的資料架構指南,探討如何為 Agentic AI 準備企業資料基礎。
中文獨立開發者深度總結 AI 祛魅期的工具退潮、流程反噬與真實翻車防線。
開發者深入探討長執行週期 Agent 如何避免累積壞記憶與雜訊的實戰痛點。
探討如何為 CI 故障診斷代理建構基於成本矩陣與根本原因分析的決策模型。
探討為何檔案系統可能是 AI 代理最具直覺性且最適合的持久化資料介面。
開發者深入反思模型基準測試的隨機性,透過多次重複實驗修正偏差的誠實踩坑分享。
獨立開發者深度探討當 AI 程式碼產出速度加快時,工程師審查與架構判斷能力的紀律要求
深入探討深度使用 AI Agent 工具如何徹底融通研究與工程編碼工作流的方法論與反思
高水準方法論:探討在不同 AI 助理之間切換時,可重複使用的 Claude 交接檔案(handoff file)應包含哪些關鍵欄位以防重複勞動
開發者比較不同旗艦模型(Opus 5 與 Fable)在實戰開發中的指令掌控度與適用情境心得
寶玉分享 Warp 如何透過人類回饋持續改進 Skill,為 Agent 建立低摩擦自我進化循環的方法論
Tony Bai 翻譯與解讀 Addy Osmani 的觀點,深入剖析為何團隊不需要複雜軟體工厂,應透過 Claude Code 與嚴謹 Spec 把控系統掌控權的實戰反思
Warp 官方探討如何為雲端 coding agents 建立閉環自我進化跟追蹤系統的方法論
非科班出身者經過 6 個月「Vibe Coding」實戰後的完整經驗總結與避坑指南。
深入剖析團隊全員使用 AI 後導致上下文破碎、協作變慢的真實痛點與團隊知識同步解法。
從本機直接執行演進到容器與雲端沙盒環境,資深開發者分享 AI 代理執行環境的演化與安全取捨。
Eric 撰寫的 ai-memory 教學手冊,提供企業導入 AI Coding Agent 長期記憶系統與跨 Agent 交接(Handoff)的完整架構指南。
Eric 撰寫的 GitHub Copilot 逆向工程與 Java Web 企業級實戰教學手冊,具備極高實作參考價值。
提出具洞察力的「負責任代理型編碼宣言」(A Manifesto for Responsible Agentic Coding),規範 AI 開發團隊的架構底線。
深入剖析真實工程任務(如 Zstd 解碼器)下 Rust 在 AI 程式碼生成時的 Token 效率表現,打破動態語言迷思,對開發團隊選型極具參考價值。
資深開發者分享在 Claude 累積大量 specs 與專案範本後,評估是否將工作流全面轉移至 Cursor 的真實取捨心得。
開發者詢問並討論在 Cursor 中搭配何種 MCP 或 Skills 來改善網頁 UI 設計一致性與創意品質的實戰交流。
獨立開發者深入探討在 Cursor 中「何時該提供更多儲存庫上下文 vs 何時該切換至能力更強的模型」的決策規則與決策樹分享。
Cline 團隊分享基於 Cline 迴圈建構大規模自動化程式碼審查代理(Code Review Agent)的實作心得。
寶玉完整複盤 AI 原生開發流程,探討人類負責關鍵判斷、Agent 執行分析與驗證的實戰工作方式。
Drew Breunig 深度反思高效能模型(如 Fable)推出後,開發者對 coding harness 與 context 策略的經濟學與取捨心態轉變。
深入探討如何透過確定性程式碼而非模型本身來決定記憶儲存路徑,解決模型幻覺帶來的錯誤長期記錄問題。
深入探討次世代 Agent 產品的核心假設:將智慧與連續性分離,由 Harness 持續維護可重建且可驗證的任務狀態。
深入研究透過 Harness 擴展(持久狀態檢查點、階段本地上下文、可恢復執行手冊)顯著提升長視野 Agent 表現,具極高實戰價值。
AI工程師分享基於難度的模型路由實驗,探討文件萃取任務的成本與效能權衡。
探討確定性代理護欄(Deterministic agent guardrails),讓合規政策轉為可追溯到具體條文的函數,而非依賴機率分類器。
實測在開源模型上運行自動化開發循環(Claude Code harness 結合 OpenRouter 端點),分享真實成本、token 消耗與合併 PR 經驗。
高品質實作心得:深刻指出代理程式的完成回報不可信,必須檢查實際後置條件(postcondition),具高實戰價值。
高品質實作心得:評測相同模型在不同 coding agent harness 下的巨大表現差異,直擊 harness 工程核心。
詳盡的企業級 RAGFlow 導入指南,作為 AI Agent 基礎架構的實戰培訓教材。
兩週頭對頭量化測試分享,探討不同位元數在真實硬體上的表現差異與取捨。
開發者分享如何正式化多重 OAuth 前沿模型的方法論與架構,有效減少偏見與幻覺。
基於半年筆記寫作 harness 評測經驗,深入分享模型摘要與檢索能力的實戰數據與教訓。
開發者分享以 SQLite triples 取代向量資料庫來建構本機記憶體架構的實戰架構筆記與踩坑心得。
Armin Ronacher 探討 LLM 如何降低語言學習與選擇的摩擦力,並帶來「快速且硬派」的寫碼方式,具深刻實戰洞察。
Martin Fowler 深入探討週末快速打造應用與企業級軟體工程的本質差異,對架構與工程管理極具啟發。
Simon Willison 探討如何高效率指導與驗證編碼代理,提供有深度的實戰觀點與驗證方法論。
探討如何向 AI 提示複雜或容易產生錯誤問題的技巧與實測經驗。
高品質實作心得:分享如何撰寫分層摘要的 Prompt 技巧,精準保留條件、限制與條件句,對處理長 PDF 具高度實戰價值。
高品質實作心得:深入探討 A/B 測試 Claude Skill 變更時常被忽略的踩坑點(如 frontmatter 命名衝突)並提供自動化解法,極具工程實戰價值。
深度拆解 Fiber 雙緩衝機制在 Agent 狀態設計中的實作原則(試算、原子切換、回滾),極具架構啟發性。
Eric 撰寫的企業級 Multiplayer Agent Harness (QM) 導入完整實戰指南,架構與實操細節極為扎實。
獨立開發者分享將上下文從 100KB 縮減至 2KB 反而提升穩定度的踩坑經驗與 superseded state 核心省思,極具實戰價值。
探討 LLM 在工業暫存器表格分類與欄位映射上的實戰瓶頸與管線設計難題。
獨立作者深度測試「代碼驗證、模型生成」Harness 模式的完整踩坑與對比心得,達到最高等級實作分享標準。
提供 QLoRA 微調小模型的完整實戰數據、配方與混淆矩陣分析,高信號實作心得。
具體測量 prompt 緩存對一致性幻覺偵測的成本影響,附帶封閉形式成本模型,極具實戰參考價值。
Eric 總結的企業級 Prime Agent 完整導入與實戰教學手冊,技術棧與架構指引極為詳盡,對企業導入 Agent 有極高實戰價值。
Eric 撰寫的 Semantica 企業級 Context Graph 與 Knowledge Graph 基礎設施導入指南,對架構師與 AI 平台團隊極具參考價值。
Eric 整理的 PostgreSQL 19.x 企業內部教育訓練與團隊開發規範手冊,對資料庫開發與維運實戰有直接幫助。
Matt Pocock 在 Latent Space 分享規劃綠地專案的 /wayfinder 技能實作,具備高品質方法論與實用 prompt/agent 技巧。
開發者分享血淚教訓:指出 Cursor 迭代次數上限(iteration cap)與費用預算上限(budget cap)的本質差異,血淋淋的踩坑經驗對控制 API 成本有極大幫助。
資深開發者整理接手 AI 生成專案(vibe-coded)前的紅旗檢查清單,包含硬編碼機密、零測試與巨型檔案等真實技術債,具備極高的工程實戰價值。
Tw93 分享將開源 CLI 工具轉為 Mac 付費軟體的獨立開發心得與踩坑反思,對獨立開發者極具啟發性。
引用探討 LLM 時代可延伸軟體的新機會,對 AI 應用架構設計具啟發性。
Simon Willison 透過 Claude Code 深入實測 smolmachines 沙箱來運行不受信任的程式碼,極具獨立開發者的深度實作與踩坑價值。
深刻指出 Prompt 問題本質上是 Context 問題,強調給予 agent 持久化上下文比反覆微調 prompt 更重要,切中 Context Engineering 核心。
具體剖析提示詞中缺乏可衡量標準(measurable criteria)會如何導致模型崩潰,並給出具體範例。
作者分享燒掉 2,000 點數後學到的影片提示詞實戰心得,誠實揭露反覆調整的盲點。
探討 Context Engineering 與 Prompt Engineering 核心差異的技術文章。
分享一個透過讓 AI 先問問題來引導使用者寫出真實語氣作業討論板貼文的實用 prompt 技巧。
詳細分享除錯語音代理(voice agent)停頓判斷與對話輪次交接的真實踩坑經驗與解法。
透過 1,080 次嚴格實驗測試系統提示詞中重複重要指令次數對模型遵循率的影響,提供數據支撐的優質 prompt 工程方法論。
陳廣亮深刻探討 Agent 產品的 UI 設計,指出 Chat 只是建立信任的最低成本介面,一旦信任建立就該由工具面板與狀態观测層取代,具備極高的產品與前端架構指導意義。
Tony Bai 探討在 AI 大規模生成程式碼的時代,為什麼基礎設施更需要 Rust,並重新定義了 AI 時代學習系統語言的心智模型。
Tony Bai 深度拆解最新《Self-Evolving Coding Agents》綜述,結合專欄中的 Context Compaction 與錯誤自愈等模組,為開發者提供一張從手工靜態 Harness 邁向自生長智能體的完整工程地圖。
Phil Schmid 示範用 150 行 Python 與 Gemini 3.7 Flash 操控 Android 模擬器玩遊戲的具體步驟,是極佳的實作教學。
深入討論如何防止 Coding Agent 重複犯錯的實戰痛點,探討規則檔案過長與上下文管理的權衡,極具實戰參考價值。
開發者反思並分享放棄讓 LLM 直接生成健身數據、改用純函式控制核心邏輯的踩坑心得,展現極高實戰價值。
深刻指出「工具 Schema 定義就是模型評估單元的一部分」,點出工具介面變更對 Agent 推理的隱含影響,具備極高架構洞察力。
極佳的獨立開發者踩坑與 Prompt 技巧分享,示範透過「給予錯誤範例」反而成功引導分類代理避開模糊邊界的冷門絕招。
專業人士分享如何透過設定心態(如扮演不知者、要求確認機制)來解決 ChatGPT 盲目自信與假答案的實戰 Prompt 技巧。
深度解析為什麼缺少「釐清迴圈機制(Clarification Loop)」的提示詞會導致模型崩潰,並提供架構層面的 Prompt 設計反思。
探討提示詞工程師在面對 AI 代理(Agents)而非一般聊天機器人時,系統提示詞與規劃步驟的差異與實戰技巧。
探討 Agent 叢集擴展的極限與真實實驗反思,對理解多代理人協作架構非常有價值。
深度探討獎勵駭客(Reward Hacking)對評測指標帶來的失真問題,對 AI 評估機制有高價值的批判思考。
r/cursor 探討當專案在 Cursor、Codex 與 Claude Code 之間切換時,如何透過可檢視的交接層保留專案狀態與避免重蹈覆轍
開發者在 r/cursor 深入探討當 AI 宣稱修復 bug 後,真實的驗證工作流、踩坑經驗與花費在審查的時間成本,具極高實戰價值
深度反思:與 AI 協作如何更像是在進行領導而非單純寫程式。
開發者分享如何使用 Codex 自動研究並達到 232 倍加速核心(Kernel)的真實心得。
深入探討 Model Context Protocol(MCP)作為 Agent 界 npm 所帶來的供應鏈安全風險與除錯經驗。
高見龍實作防範 Agent 路徑跳脫與 symlink、將 Agent 關在工作目錄內的實戰教學。
Sebastian Raschka 詳細教學從零建立 AI 文字檢測器的端到端專案(含資料集、訓練與部署)。
介紹如何借鏡 React Hooks 架構設計 AI Agent Harness(Flue 2)。
開發者探討當同一個模型兩次輸出不同答案時,如何理解其背后的隱含問題而非盲目修補提示詞。
深入探討coding agent 記憶體設計:不只存對話,更該儲存成功修改之因果歷史的架構反思。
作者開源分享累積一年、結合數百位開發者實戰經驗的 Agentic Coding 書籍與心得。
開發者分享在 LangGraph 中結合推理與結構化輸出(Pydantic)的實戰架構與踩坑經驗。
Simon Willison 分享不使用傳統分類改用向量檢索與幻覺技巧來標記內容的獨特方法,極具實戰啟發
Tony Bai 梳理 Google 官方論證為何 Go 語言在 AI 時代具備審程式碼優勢及社群交鋒
獨立作者分享將食譜與個人數據餵給 Claude 進行個人化飲食規劃的真實實作心得與效果
開發者社群深入交流日常實際使用 Claude Code 的多種工作流配置(終端機、IDE、容器、網頁)
獨立開發者分享利用 Claude Code 從零完整打造並發布健身休息計時器 App 的真實踩坑與實作心得
真實測試讓 Claude Code 使用真金白銀進行股票交易的踩坑與結果分享
深入診斷 RAG 系統中三種不同根源的失敗型態與對應修復方式,是極高水準的工程除錯指南。
深入剖析缺少角色設定的提示詞如何導致模型猜測與崩潰,具備高指導性。
精準解決長報告轉簡報時的壓縮比例失控問題,提供具體可執行的 assertion-evidence 提示詞框架。
精闢解析如何透過硬性限制(Constraints)而非形容詞來消除 AI 內容的平庸感,極具寫作實戰價值。
深入探討提示詞版本控制與 PM/工程師工作流衝突的真實痛點與反思,極具實戰價值。
針對本地實體店面設計的高互動提示詞框架,摒棄企業八股,具備極高的接地氣實戰價值。
企業級 AI Coding Agent Runtime / Multi-Agent Workspace 完整導入指南與教學手冊
深入探討 AI 輔助寫程式帶來的軟體工程中產階級消失與維護盲點現象
系統梳理 Rust 基金會與專案之間「權錢分離」治理結構與商業化機制的深度文章
深入探討 AI Agent 應用程式決策迴歸測試的盲點與案例分析,極具實戰價值
生產環境運行 AI Agent 實際發生故障(重試循環、狀態過期等)的真實慘痛經驗訪談
分享以影響範圍(Blast Radius)替代相似度來排序 RAG 檢索結果的實戰架構調整
探討程式碼審查 Agent 如何在面對不確定性時建模決策(合併、測試或求助人類)
Anthropic 官方分享建構有效 AI Agent 與 Harness Engineering 的實作方法與架構指南
Simon Willison 推薦工程師使用 AI 寫作時的誠實取捨與內部守則,具備極佳的 AI 方法論價值。
探討 AI 編輯器無法確實持久化自定義規則的常見痛點與 prompt 調整經驗分享。
開發者深刻反思 AI 產出大量程式碼後帶來的審查成本與「審查比寫還累」的真實痛點分享。
開發者詳細分享在 agentic 程式編寫中遭遇的權限迴歸、工具偏好與實際防守除錯經驗。
Martin Fowler 團隊深度探討在 agent 迴圈中使用測試驅動開發(TDD)究竟是作秀還是真有價值,極具實戰啟發。
詳細探討領域特定微調的最佳實踐與權衡,對企業落地有實戰幫助。
陳廣亮深度解析將前端測試思維遷移至 Agent Eval 的核心方法論,直面 Flaky Test 痛點並給出具體實作案例。
陳廣亮高質量實作連載完結篇,深入探討前端 Agent 上線的 token 帳單控管、tracing、三層預算熔断與美元熔斷機制,具備頂級實戰價值。
高見龍分享在專案中包裝 ripgrep 讓搜尋結果帶回完整上下文供模型使用的實作經驗。
獨立開發者分享從零訓練 1B LLM 的完整成本、程式碼與微調實戰心得,具備極高透明度與技術信號。
Hacker News 熱議:開發者分享如何有效利用 LLM 學習複雜領域知識的實用心得。
高見龍系列文章:探討 coding agent 該整檔重寫還是用字串替換(old_string)的實作取捨。
Simon Willison 分享使用 Codex 與 GPT-5.6 一鍵製作遊戲的完整實戰心得與提示詞技巧。
Simon Willison 深度引述與分析 Claude Opus 5 系統提示詞,具備高度參考價值的實戰解析。
高品質實作心得:開發者分享因為模型本身無法解決問題,因而動手打造包裹在 coding agent 外圍的 Harness 系統。
探討 LLM agent 在操作運行中應用程式時,除了原始碼外還需要觀察哪些執行期狀態的架構思考。
真實「踩坑」分享:coding agent 加上 API 重試機制卻因為缺乏冪等性造成下游資料重複寫入的慘痛教訓。
本地優先程式碼知識圖譜與 AI 程式碼審查引擎的企業級完整導入指南
資深工程師撰寫的開源 Code Review 引擎教學手冊,含完整架構、工具串連與企業導入實戰
探討修正提示詞(Revision Prompting)如何改善工業級 LLM 處理流程
基於 4k 場遊戲數據統計,分析人類審查 AI agent 指令時忽略威脅的比例,具安全防護實戰參考價值。
陳廣亮深度解析 subagent 機制本質如 Web Worker,並透過 tiny-agent 原始碼實作分享任務拆解與帶參數規範的實戰方法論。
Simon Willison 實測使用 Claude Fable 5 與 Claude Code 透過 tweet 一次性打造出小遊戲,具備極高實戰價值與踩坑心得。
Cursor 團隊分享建構雲端 agent 一年來的經驗教訓與架構取捨,具高實戰信號。
Mistral 分享建構專門自動編寫 Rails 測試的 autonomous agent 實戰心得,包含讀取源碼、生成 RSpec、CI 驗證等具體流程。
詳細拆解如何將專案文檔轉化為 AI Agent 隨查隨用的 Knowledge-as-Skill 引擎,對 Claude Code 等工具的實戰整合有直接幫助
探討如何利用 reverse-skill 打造 AI Coding Agent 的技能路由,兼具資安研究與 agentic workflow 的深度工程實踐
深度分享 OfficeCLI 於 AI Agent 自動化架構的實戰教材,包含確定性路徑定址與固定 schema 取捨,具極高實作參考價值
深刻剖析 prompt 形式的 LLM guardrails 在生產環境失效的根本原因,並提出具體的執行邊界與 CI 檢查觀點
深入探討在大專案中透過持續演進的知識庫(GCE)注入領域知識,解決 agent 重複犯錯與文檔飄移問題的扎實架構
開發者分享在 eval 過程中遭遇意外付費 API 消耗的痛點,並動手打造帶有硬性中止與花費控制的評估 harness 實戰經驗
提出「meat proxy」概念,反思開發者不應盲目複製貼上 AI 輸出,而需經過理解與驗證,對實戰心態很有幫助。
Thoughtworks 峰會報告指出程式碼生成已過剩,真正瓶頸是「驗證與治理」以及「Harness Engineering」的崛起,極具前瞻指導性。
創辦人分享在共同空間中實時互相觀看提示詞一個月的深刻轉變,探討團隊協同提示工程的強大效果。
深度探討透過手動重打 LLM 生成的程式碼來防止認知債務的高品質開發心得
探討初學者使用 Claude Code 常犯的錯誤:將其視為聊天機器人而非合作夥伴的實戰建議
獨立開發者分享利用三模型 Funnel(Haiku/Sonnet/Opus)架構打造自架相片篩選工具的完整架構與成本效益分析
獨立作者分享透過 Claude Code 管線讀完整部漫畫並建立龐大研究檔案庫的史詩級實作心得
開發者進行嚴格對照實驗,測試高階模型指揮廉價 worker 模型架構的成本效益與出乎意料的發現
深入討論程式碼代理的動態上下文發現(Context Engineering)技術與 Harness 設計
資深開發者分享從 TL 到 EM 的心態轉變:當 Coding Agent 越過可信門檻後,人的價值如何從盯實現轉向定方向與驗證結果
深入探討 AI 代理的權限分級、確認門與 JSONL 审计日志實作,解決「rm -rf 重試三次成功」的安全性痛點
深入拆解 Claude Code 的核心架構:其實就只是一個模型、迴圈、工具與 context 組成的 while 迴圈
探討透過自我總結(self-summarization)訓練長視野編程任務,有助理解 agent 訓練方法
Learn Claude Code 企業級 AI Coding Agent Harness Engineering 實戰白皮書與教學手冊
Simon Willison 深度解讀 Model Context Protocol (MCP) 2.0 無狀態通訊協定的重大更新與影響
Cursor 官方發布的代理協作最佳實踐與實戰互動模式指南
Jina AI 教學:如何使用 Model Context Protocol (MCP) 與 Jina 遠端伺服器建構代理化檢索工作流
Jina AI 深入探討次模最佳化(Submodular Optimization)在文字選擇、段落重排與上下文工程中的應用
中文獨立作者深度解析 Agent 開發中的語義故障與驗證難題,提出結合重試、極限步數與獨立上下文 Verifier 的具體方法論與實作架構。
Simon Willison 分享將自訂 MCP 伺服器連接到 Claude 和 ChatGPT 標準介面的實作經驗(TIL),具備動手參考價值。
資深產品經理分享如何將 PRD 轉化為 Prompt,並透過 Claude Code 管理架構師與開發團隊建立個人軟體的真實工作流心法。
牙醫師分享利用 Claude Code 從零打造具備複雜文件結構與模板功能的完整診所管理軟體的實戰心得。
深入探討利用 Claude Code 開發專案時,如何解決從 70% 推進到 100% 完成階段所面臨的優先級混亂與除錯難題,具極高實戰價值。
作者針對 5 種熱門 Token 節省方法進行 140 次真實任務 Agent 跑分測試,提供誠實且具數據支持的踩坑與行為影響分析,極具實戰參考價值。
開發者真實比較 Opus 5 與 Fable 5 在協同寫作與編碼上的行為差異與管線配置經驗(Fable 5 協調器 -> Opus),具實戰工作流參考價值。
JetBrains AI 實測分析編碼代理的 token 節省外掛,帶有實際 A/B 測試數據與踩坑評估。
Simon Willison 整理 Anthropic 研究員利用 Claude 尋找密碼學漏洞並附上原始 prompt 的實用分享。
深入探討 Agent Harness 架構(Guides、Sensors 等六大能力)以提升模型表現,高度對應 Harness Engineering 核心主題。
分享如何有效管理 AI Agent 的 Skills 與 Tools 來保持 Context 乾淨的實戰方法,屬於高價值的 Harness Engineering 經驗。
極為實用的複製貼上 Prompt:將凌亂會議記錄轉化為乾淨的『決議事項』與『待辦負責人』兩大列表,完美取代臃腫的 AI 會議助理工具。
高度實戰向的 prompt 技巧:強制模型在每個數字後標註 [DATA]、[DERIVED] 或 [ESTIMATE] 以避免幻覺,對數據分析極有幫助。
極佳的實戰技巧:利用 system prompt 末尾加入『Output contract』來防止長對話中格式漂移,解決重複生成的問題。
探討 prompt 壞習慣的社群討論,幫助開發者反思並精簡提示詞設計。
深入實測比較 Claude、ChatGPT 與 Gemini 在建構 AI 文字去機械化工具時的字數限制與工作流踩坑心得。
高水準的開發心得:將 Prompt 視為軟體需求規格書(SRS)而非隨意請求,強調規劃與邊界條件對提升 AI 輸出品質的關鍵性。
探討 NotebookLM 腳本生成的 Prompt 架構與嚴格依據來源防幻覺的策略,具備高度工程價值。
深入淺出探討 Agent 的 Context 管理與記憶體持久化(Context Engineering/Lazy Loading),附帶實作程式碼架構思維,極具高價值
探討 LLM 如何讓大眾成為通用型人才並獎勵專業的思辨文,屬於高水準的 AI 使用心態反思
Tony Bai 基於產業大會整理的深度文章,剖析「黑灯軟體工廠」與編碼大模型在訓練中缺乏可維護性獎勵信號的根本問題,並給出實戰解法,水準極高
極佳的實戰工作流分享:透過專案內的 task-to-model 路由矩陣控制成本,避免浪費高階模型處理簡單 grep 任務。
深度分享透過授權 Claude 自主加 log、跑測試、分析錯誤的 agentic debug 迴圈真實心得與方法論。
Eric 深度更新的 AI 方法論比較教學手冊 (2),系統性比對多套主流 AI coding 方法論與工具,具備極高實戰參考價值
獨立開發者分享製作 Claude Code skill 將手寫字轉為字型的實戰心得,含具體命令、處理方式與本地開源 repo,極具實用性
ByteByteGo 的文章,總結了構建生產級 AI Agents 的最佳實踐,提供了實用的方法論。
陳廣亮分享了 prompt 像 CSS 的概念,探討了 system prompt 的層級、級聯和覆蓋,並通過 tiny-agent v0.4 進行對比,這是關於 prompt engineering 的深度實作分享。
這篇文章透過 SignalPay 實際演示了 AI 輔助的 quality-first 程式碼變更工作流,包含具體步驟和方法論,高度符合使用者偏好。
r/LLMDevs 上關於如何驗證 LLM 輸出的討論,探討了 manual spot-checks、LLM-as-judge 等方法,以及其痛點,直接針對 AI 實戰評估的核心問題。
r/LLMDevs 上分享了 Frugal 插件,透過路由 sub-tasks 到最便宜但能勝任的模型,來節省 Claude Code 的成本,這是實際應用中控制開銷的有效方法。
Reddit 貼文分享如何區分 prompt engineering 真正起作用的行銷工具和通用輸出的工具,並以 Claude 為例,強調 prompt 的價值,有助於判斷工具和優化 prompt。
Reddit 貼文作者追蹤兩年 prompt engineering 時間分配變化,發現從 prompt crafting 轉向 context architecture 和 integration,反映了 AI 實戰工作流的演進,是寶貴的經驗分享。
Reddit 貼文分享一個將會議記錄轉換為簡報大綱的 prompt,強調了 prompt 的重要性,能將原始資料轉化為結構化輸出,有實戰價值。
Reddit 貼文分享如何建立一個確定性的 prompt 優化循環,利用 LangChain evals 和 Claude Code,展示了如何透過迭代優化將 prompt 效能從 80% 提升到 98%,是實際可行的 prompt 工程方法。
用戶分享 LLM 請求成本翻倍的原因是重試和過長的上下文,而非流量增加,揭示了隱藏的成本陷阱,提供了優化實際應用成本的寶貴經驗。
用戶分享開發了一個讀取賽馬程式並進行分析的 AI 工具,並獲得了第一個付費客戶和 bug 回報,這是一個將 AI 應用於特定領域並走向商業化的真實案例,包含實戰細節和挑戰。
Kilo Code 博客分享了他們如何讓 AI(Kilo)學會自我測試。這涉及到 AI Agent 的自主性與驗證能力,是關於提升 AICoding 效率和可靠性的重要方向,對開發者有實戰參考價值。
Sebastian Raschka 的文章探討了 LLM 如何學習不同程度的推理模式(低、中、高)。這對於理解和控制 LLM 的行為,進而優化其在實際應用中的表現,具有基礎性的指導意義。
文章介紹了從「Loop Engineering」到「Graph Engineering」的轉變,並提供了一個 14 步的實操路線圖,指導如何利用 Claude Code 構建動態工作流。這涉及了 Harness Engineering 的概念,並提供了具體的實踐方法,對開發者有直接幫助。
作者深刻探討了 Agentic Loop Coding 的侷限性,指出其有效性高度依賴於明確的錯誤反饋。通過真實案例(Claude Code 修正 bug 的兩種情況),說明了「靜默失敗」的危險。這是對 AI Agent 實戰使用的深度反思與踩坑分享,極具價值。
作者分享了自己為了解決 AI 助理(Cursor)重複犯錯的問題,編寫特定規則來防止這些錯誤的實戰經驗。列舉了具體的規則條目,旨在提高 AI 程式碼生成的可靠性。這是典型的獨立作者分享個人化工作流與問題解決方法的案例。
作者詳細分享了自己構建 AI Agent 的工作流程,特別強調了「對抗性審查」的使用不同模型來避免相關盲點,以及回顧的重要性。這是一篇結合實踐經驗、具體步驟和有效方法論的深度分享,完全符合使用者對高品質實作心得的要求。
作者分享了使用 AI Agent 重建 SQLite 的經驗,並在 Cursor 官網博客發布,強調了 Agent Swarms 的潛力以及不同模型組合對成本的顯著影響。這提供了關於如何利用 AI Agent 進行複雜任務的實戰案例與成本考量,符合使用者對真實工作流程分享的期待。
r/LLMDevs 分享一個 Agent Harness,將 fine-tuning 整合到 Agent 的迴圈中,能學習和自我修正,強調本地運行和避免訂閱,是獨立開發者分享的實作工作流。
ByteByteGo 闡述 AI agent 之間如何溝通與協作,並結合工具,是關於 agentic workflow 的方法論討論。
作者深入解釋了 LLM 沒有記憶,Context 就是 State,且每次全量重渲染的原理,並分享了如何透過 React 的 diff/memo/Fiber 來優化,這是一個關於 AI Agent 實現原理的深度解析和實戰優化方法。
Hugging Face 分享了從建置 Shippy 的經驗中學習到的有關建置 agent 的方法論,這符合使用者對於實作技巧和工作流程分享的高度偏好。
Simon Willison 引用 Thibault Sottiaux 的經驗,討論了 GPT-5.6 在啟用全權限模式下意外刪除檔案的 '踩坑' 情況,並分析了原因,符合獨立作者深度分享的標準。
Phil Schmid 分享了如何構建 Gemini Managed Agents 以安全地使用 GitHub CLI,而無需暴露 PAT,這是一個關於安全實作的具體工作流程分享。
討論如何在長篇生成中避免模型前後矛盾,透過將 Context 視為 State 並全量重渲染,這是一個關於 LLM 記憶和 State 管理的深度實戰技巧。
作者分享了 Prompting 風格的轉變,從直接提問轉向更深層次的問題(如假設、實驗),並探討 LLM 如何改變我們處理不確定性的方式,這是關於如何更有效利用 LLM 進行思考和決策的實戰分享。
作者分享如何建構一個能夠自動學習和改進的程式碼審查 Agent,並整合到 Cloud Software Factory 中,具有高度的實作價值和方法論指導。
作者分享了他如何為 Claude Code 建立一個『上下文包』(CLAUDE.md + docs/claude),以避免其在大型生產程式碼庫中盲目搜尋,顯著提升了效率。這是關於優化 LLM 在大型專案中使用的絕佳實戰方法。
作者分享了讓 Claude 無人值守運行三小時處理遷移任務的經驗,以及對自身工作的感受。這是一個關於信任、工作流程和 AI 協作的真實心得分享。
作者分享了如何利用 Claude 幾乎完全建構了一個求職工具,從履歷整理到職涯建議,詳細描述了整個過程,是 LLM 在個人專案開發中的絕佳實例。
Martin Fowler 介紹 Nik Malykhin 如何利用 LLM 協助進行老舊 Java 程式碼的現代化改造,強調了 grounding 的重要性,是具體的工作流程分享。
作者將 React Fiber 的三大機制(雙緩衝、time slicing、lanes 優先級)映射到 AI Agent 的狀態儲存設計,基於實際的 AGENTS.md、loop debt、ponytail 實測經驗,提供了三條實用的設計原則。
作者從前端開發者的視角,將 AI Agent 的核心機制解釋為一個 `while` 循環,並對比了 chatbot、agent 和 workflow,提供了一個 32 行的 Tiny-Agent 範例,清晰地解釋了 agent 的運作原理與實作方法。
Simon Willison 觀察 coding agent 和 Opus 4.5 模型對其開源專案影響的程式碼頻率圖,屬於對 AI 影響的實證觀察。
Simon Willison 分享如何透過特定方法技巧,發現 Claude 網頁抓取工具的潛在數據外洩漏洞,是真實的踩坑與安全研究,極具實戰價值。
使用者分享使用 Claude 建構一個模擬市場時機的網頁遊戲,並進行了 1000 次的隨機測試來驗證其成效,這是典型的以 LLM 進行專案開發的深度實作分享。
作者開發了一個名為 'solidifier' 的 Skill,教導 Claude Code 如何應用 SOLID 原則和設計模式,同時避免過度工程化,這對於生成更易於維護的程式碼非常有幫助。
作者分享了一個簡單但有效的技巧,透過要求 agent 在每次回覆中稱呼使用者名字,來偵測 agent 是否在中途開始忽略指令,是 agent 開發與調試的實用技巧。
作者分享使用 Claude Code 作為寫作輔助工具,並測試了 AI 檢測器,證明 AI 輔助寫作也能通過檢測,展現了 AI 在創意工作中的實用價值與其輔助性質。
使用者分享使用 Claude Code 開發戰鬥機遊戲的經驗,涵蓋飛行控制、AI、武器系統等,是具體的實作與開發流程分享。
作者強調在 AI Agent 開發中,人類必須堅守系統設計的「外環」,負責邊界設定、最終裁決和責任擔當。這對於理解如何平衡 AI 自動化與人類控制至關重要,是高價值的實作方法論。
獨立作者分享利用 Claude Code 改寫實際交易程式碼的經驗,包含具體步驟、誠實的取捨和踩坑心得,符合高價值實作分享的標準。
Simon Willison 分享使用 uvx 在 GitHub Actions 中進行快取優化的實戰技巧,包含具體設定與考量,屬於高品質的實作心得。
分享使用 'protocol' 類似 System Prompt 的方式,讓 LLM 模擬 mini OS,並在 Qwen3-235B 上獲得良好效果,是關於 System Prompt 應用的深度實踐。
分享如何建立 agent 來監控系統,以在客戶回報前發現 Bug,強調從事後補救轉向事前監控的實戰工作流轉變。
尋求提取 Claude 專案所有資訊的 prompt,屬於具體的 prompt 工程應用問題,希望能收集有效 prompt。
獨立作者分享將 Claude 交給大量雜亂的收據和發票,讓其在過夜後整理成乾淨表格的經驗,是高品質的實作心得與工作流分享。
分享一個極簡 prompt 的實戰技巧,透過 'use bhived' 指令讓 agent 主動提取所需上下文,提出與傳統長 prompt 相反的策略,屬於高品質的 prompt 工程洞見。
強調 RAG 管道中,用於重寫用戶查詢以生成嵌入的 prompt 的高效率,提供了具體的 prompt 工程優化技巧。
舉辦一個一次性 prompt 比賽,強調在單一 prompt 下產生豐富結果,屬於對 prompt 設計極致的實踐與挑戰。
探討 prompt 作為介面的可能性,提出一個實驗性的開源專案 Digita,以數字選項引導使用者,是高品質的 prompt 工程實作分享。
Hamel Husain 進行了自動化評估與人工標註的比較研究,分享了實際的實驗結果和發現,有助於理解評估方法的有效性。
深度解析了 spf13 的『Idiomatic Go』理念,反對將 Java/Spring Boot 的設計模式引入 Go,並指出其對 AI 編程智能體的影響,強調了 Go 的簡潔與可讀性,對 Go 開發者和 AI Agent 的程式碼訓練有重要指導意義。
深入探討了 Prompt Injection 如何將 Code Review Agent 變成內部威脅,分析了傳統安全模型在 Agentic 流程中的不足,並提出了解決方案,對 AI 安全實戰有重要參考意義。
作者分享了如何透過『可執行的本體論』解決 LLM 在圖譜檢索中出現『自信的錯誤答案』問題,提供了具體的技術解決方案,對構建更可靠的 AI 系統有價值。
這篇文章關注 AI 編碼成本優化,這對實戰使用者非常重要,開發者需要關注如何控制 AI 使用的開銷,具有實際指導意義。
透過 660 次實驗揭示了程式碼品質對 AI 助手 Token 消耗的影響,強調了乾淨程式碼在 AI 時代仍然重要,直接關乎開發成本和效率。這是非常有價值的實戰洞察。
作者詳細分享了 19 天、245 次 session、1.23 億 tokens 使用 Claude Code 的經驗,重點強調了 CLAUDE.md 和持久化記憶的重要性,提供了極具價值的實戰工作流和技巧。
分享了本地 LLM 在編碼方面的實戰經驗,比較了不同模型的表現,並嘗試了最適合日常使用的模型。這直接關乎開發者的實作選擇和效率。
r/ClaudeAI 社群用戶分享使用 Claude Code 構建了一個開源的 AI-native 影片編輯器 Velorn,並且 Claude Code 不僅參與開發,還能直接操作編輯器進行編輯、生成媒體、混音等,展示了 AI 在複雜應用開發和操作上的深度整合。
r/ClaudeAI 社群用戶分享使用 Claude 分析 Google Search Console 數據的具體工作流程,以進行 SEO 優化,帶來顯著的流量增長,這是非常實用的內容行銷和 SEO 實戰。
r/ClaudeAI 社群用戶分享使用 Fable 構建一個 5MB 的 Pirate MMO 遊戲,遊戲的大部分邏輯由 Claude Code 生成,展示了 AI 在遊戲開發中的強大實作能力和程式碼緊湊性。
r/ClaudeAI 社群用戶分享一個實用的習慣:讓 Claude Code 記錄自己的決策過程,以解決長期 session 中上下文壓縮導致遺忘問題,這是提升 agent session 可靠性的實戰技巧。
r/ClaudeAI 社群用戶分享如何使用 Claude 構建個人財務、會計、CRA 應用程式,取代 QuickBooks,展示了 AI 在個人工具開發和自動化上的深度實作。
分享 GLM 5.2 在本地低資源環境下執行的經驗,並進行優化,提供給希望在有限硬體上運行 LLM 的開發者實用參考。
詳細介紹 Bun 如何利用 64 個 Claude 實例,在 11 天內將 Zig 代碼重寫為 Rust,並提出了「機械翻譯」、「實現者與審查者分離」等工程方法論,展示了 AI Agent 在關鍵基礎設施重寫中的巨大實戰潛力。
深度拆解 AI 4 層技術棧(模型、Harness、Loop、Agent),強調 Harness 的重要性,並介紹了 Context Engineering、Self-Harness 等前沿概念,為 AI 時代的開發者指明了系統架構的實戰方向。
分享使用 GLM 5.2 輔助生成一個可玩的 3D 遊戲的經驗,展示了 AI 在遊戲開發的第一次迭代中就能產出不錯結果,並包含遊戲連結和程式碼品質的討論,是 AI 輔助程式碼生成的極佳實戰案例。
比較了 27B 和 75B 模型作為 agent 的表現,指出少輪次(fewer turns)比快 token 更重要,並附帶了具體配置和測試結果,這是關於 agentic agent 設計非常深刻且實用的見解。
Simon Willison 深度解析 Bun 專案的 Zig 轉 Rust 重寫,包含複雜的代理工程、動態工作流等,是高品質的實作心得。
深入解析 MCP Server 的架構模式和反模式,特別強調工具數量對 LLM 準確性的影響,是針對開發者的詳實工程指南。
作者詳細介紹了 '12D map' 技術,如何將大量文本壓縮成可搜尋的地圖,用於學術論文寫作,是關於 Prompt 工程與資訊組織的深度實踐分享。
作者提出「Prompt 周邊系統才是 Prompt」的觀點,強調了 Prompt 工程中工具鏈和評估機制的關鍵性,是深入的實作心得。
作者分享如何透過設定固定指示來約束 AI 避免修改不相關的程式碼,這是一項非常實用的 Prompt 工程技巧,解決了實際開發中的痛點。
作者分享如何建立一個個人輔導 Claude Skill 和 Prompt,幫助解決學習後遺忘問題,體現了對個人學習方法論的深度思考與實踐。
作者分享如何利用 GLM 5.2 Fast 在四天內完成一個月工程量的功能,並詳細說明了使用 fast open models 的經驗和成本,是高品質的實作心得。
Strix 的完整教學手冊,針對 AI Agent 自動化滲透測試、DevSecOps 等場景,提供了詳細的實戰指南,對安全領域的開發者極具參考價值。
作者詳細記錄了如何將舊的 govanityurls + Nginx 遷移到 gvu 工具,解決了 Go 私有模塊拉取的核心痛點,這對 Go 開發團隊來說是極其實用的實戰遷移指南。
Lilian Weng 總結了 35 篇關於 Harness Engineering 的論文,提供了對這個新興領域的系統性梳理,有助於理解其方法論。
作者建構了一個 AIM 啟發的即時通訊軟體,每個好友都是持續保持角色的 Claude agent,這是一個關於如何設計和實現高度互動、角色扮演型 AI agent 的精彩實作。
CodeAlmanac 是一個為程式碼庫自動更新的 Wiki,它能根據用戶與 Claude/Codex 的對話來更新 Wiki 內容,這是一個利用 LLM 知識管理和自動化文件生成的實戰方法論。
Martin Fowler 旗下的研究者分享了本地 LLM 在程式碼開發中的可行性因素,這對希望在本地環境中實戰 AI 的開發者提供了重要的考量點和實用建議。
這篇文章實際測試了 Caveman 的 token 壓縮效果,並與其宣稱的效益進行比較,提供真實的實戰評估與發現,具備高度的參考價值。
介紹了 Harness Engineering 的概念,特別是將其應用於 AI 自我改進,這是一個關於如何系統性設計和訓練 AI 的進階方法論。
提供使用 Claude Code 構建 AI 循環系統(Loops)的詳細實戰指南,包含具體的文件結構、關鍵要素和注意事項,為開發者實現自動化工作流提供了系統性的方法。
一個沒有程式背景的使用者,透過 Claude 創造了一個完整的遊戲,展示了 AI 在加速原型開發和實現複雜功能方面的強大實戰能力,並提及了踩坑經驗。
分享了如何利用 Claude Code 的 Fable 5 模型來優化現有的工作流程和系統,而非僅用於一次性任務,這提供了具體的系統性工作流改造思路。
作者分享了 Codex 在日常知識工作中的具體應用案例,包括資料整理和個人知識系統的搭建,提供了將 LLM 融入實際工作流程的深刻見解和實操技巧。
Warp Blog 介紹如何在雲端軟體工廠中加入 spec-driven development,以處理複雜或模糊的問題,提供了一種系統性的工作流方法。
作者分享了 side project 'ponytail' 如何通過 7 步 decision ladder 解決 AI Agent 過度寫程式碼的問題,並附帶 A/B 測試數據。這是一個非常具體的、基於實測的工作流改進方法論,直接幫助開發者控制 AI 產出。
這是一份詳細的 Anthropic Cybersecurity Skills 教學手冊,涵蓋了設計理念、架構、設定、實戰應用及安全審查。儘管標題有「教學手冊」,但其內容相當深入,對有相關需求的開發者來說是實用的實戰指南。
Simon Willison 分享了使用 Claude Code 進行 `sqlite-utils` 4.0 版本發布的經驗,包含具體的 prompt、在 iPhone 上使用 Claude Code 進行程式碼審查的過程,以及如何確保發布品質,是高品質的實作心得與工作流分享。
作者分享了一個 4-token 的 prompt 設計框架,旨在解決 AI agent 產生「精神上不正確」的程式碼問題,而非僅僅是小 bug。這提供了實際的 prompt 工程技巧和方法論,直接幫助使用者提升 AI 產出品質。
作者分享了一個解決方案:讓 Cursor, ChatGPT, Claude 讀取相同的 Markdown 文件作為專案上下文,從而避免重複解釋專案。這是一個直接針對多個 AI 工具整合和上下文管理痛點的實戰工作流分享。
作者分享了如何建構一個 Cursor workspace,用於在不同姿勢和服裝之間保持 AI 角色的連貫性,使用了 YAML 和鏈式引用。這提供了針對特定應用場景(如遊戲開發、角色設計)的具體解決方案。
這篇文章探討了在使用 Cursor 等工具時,授權給 AI agent 的權限界線問題,特別是對於具有寫入權限的工具。作者分享了權衡考量與實際思考過程,對安全與實戰應用有啟發。
Geoffrey Litt 提出「Understand to participate」的觀點,強調理解 AI 協作程式碼的必要性,以避免認知債務,是關於人機協作的深度方法論。
Simon Willison 分享讓 Claude Code (Fable/Opus) 使用者自行判斷工作方式,屬於實作技巧與方法論的深度分享,強調賦予 AI 判斷力。
Simon Willison 分享如何使用 DSPy 來評估和改進 Datasette Agent 的 SQL system prompts,這是一個關於 prompt engineering 與工具實戰應用的具體案例。
深度介紹了 20 個適用於 AI 輔助開發的循環設計模式,強調從『生成→評估→學習→改進』的閉環工程,是實戰落地的重要方法論。
分享了如何從一個 state-of-the-art 的 RAG 系統演變成僅索引少量關鍵資訊的經驗,強調了真實世界中對 RAG 系統的優化與取捨,對實戰應用有參考價值。
Eric 部落格的 VS Code + GitHub Copilot 開發 Java Web 應用程式教學手冊 (3),詳細介紹了技術棧、設定和使用 GitHub Copilot 的各種功能(Chat, Autopilot, Agent Mode 等)。這是一份非常具體的開發工作流實戰指南。
Tony Bai 編譯 Andrej Karpathy 的技術手記《LOOPS.md》,提出「Loop Engineering」範式,強調 Harness 設計對長期 Agent 運行的關鍵作用,並分享了 9 條黃金法則。這是一篇關於構建穩定、長程 AI agent 的深度方法論文章。
Warp CEO Zach Lloyd 認為軟體工廠是下一代編碼階段,並探討了工程師應如何為此轉變做好準備。這篇文章提供了關於未來軟體開發趨勢的深度見解和實踐指導。
Eric 部落格提供 Oh My Openagent 的教學手冊,定位為企業級 Multi-Harness AI Agent OS,適用於資深工程師,是詳細的系統建構指南。
Simon Willison 分享如何讓 agent 透過 shot-scraper video 記錄工作過程的影片演示,強調了 AI Agent 產生 Demo 的重要性,具備實作價值。
Qodo Blog 探討 AI 代理不應自我審查程式碼,強調獨立驗證層的重要性,並提及 Claude Code, Cursor, GitHub Copilot, OpenAI Codex 等工具,具有深入的實作思考。
r/LLMDevs 社群討論自建 Agent 評估框架的經驗,作者分享了 8 個月的使用心得、維護負擔、與商業工具的權衡,以及最終考慮放棄的過程,是真實的踩坑與方法論分享。
r/LLMDevs 社群分享使用 GLM 5.2 處理多檔案電腦視覺專案的整合筆記,評估了其在真實開發工作中的表現,包含對其上下文長度、速度和成本的考量,具有高度實戰價值。
分析騰訊 WorkBuddy 的增長策略,對比 messaging-first 與 terminal-first 的 agent 設計哲學,提供了關於 agent 產品設計和差異化路徑的深刻見解,高度符合使用者對實戰工作流的偏好。
探討使用 Email 作為 LLM agent 間非同步溝通層的優勢,特別是在跨服務協調的場景,提供了一種實用的架構設計思路。
詢問社群關於建構 AI 系統的優先關注點,強調工程層面的實際成果(如架構圖、程式碼、部署筆記、經驗教訓),非常符合使用者對實戰分享的偏好。
本地 agent memory,使用 tree-sitter + ChromaDB,為 AI agent 提供持久的程式碼庫上下文,並附帶引用,是解決 agent 上下文記憶問題的創新實作。
將 Claude Code session 記錄下來,並由 agent 整理成筆記、技能檔案和社群貼文,分享了 agent 自動化筆記和內容生成的實戰工作流。
描述了 LLM agent 在長時間任務中遺忘規則的問題,並指出benchmark分數無法反映此問題,是真實的「踩坑」分享,對開發長期 agent 的工程師有極大參考價值。
Context Warp Drive:一個確保 LLM agent 在長期任務中保持連續性的引擎,避免了 LLM 總結的缺點,提供了一種新的、更可靠的上下文管理方法,是重要的實戰方法論。
作者分享接手 AI 生成程式碼後的維護困境,並探討 Vibe Coding 的『第二年維護成本 4 倍』問題。這是極具價值的『真實踩坑分享』,深入探討了 AI 編碼的長期成本與平衡問題。
Reddit 用戶構建了一個 agent framework,模型無法直接調用帶有副作用的工具,而是由伺服器透過日誌執行。這是一個關於 AI agent 安全和控制機制的實作分享,強調了『人類在環』的真正實現方式。
Reddit 用戶分享一年來完全停止手動編碼,並使用 AI 實現了專案、工具甚至產品的交付。雖然未提及具體工具,但這是極具價值的『真實工作流程分享』,展示了 AI 在軟體開發中的實戰成果與經驗。
Reddit 用戶分享一個模型在沒有部署或程式碼變動的情況下,於一夜之間更新,導致準確率下降,並強調了這種『靜默更新』導致的問題。這是關於模型版本控制和驗證的『真實踩坑分享』,對 AI 系統部署非常重要。
Reddit 用戶測試『協同門』(corroboration gate) 是否能防禦 LLM agent 的記憶中毒攻擊,發現其成功率高達 70-95%。這是一篇關於 AI agent 安全的實戰測試和研究分享,包含具體方法和結果。
Reddit 用戶詢問在代理運行失敗時,如何追蹤導致 token 耗盡的循環,以及生產環境下代理的成本控制策略。這是關於代理(Agent)開發和運維中的『真實踩坑分享』,探討了實際工作流程中的痛點。
分享 GLM-5.2 的 Code Review 效果取決於 Prompt 設計,並將其設為日常工具,觀察其實際表現,屬於具體 Prompt 技巧的實戰分享。
ihower 分享了關於 Agent Harness 和 Loop Engineering 的演講投影片,內容深入探討了如何為 Agent 設計 Harness 和 Loop,這屬於高階的系統設計方法論,且作者為資深工程師。
作者分享了 2000 人嘗試攻擊其 OpenClaw AI 助理的實驗,並記錄了過程、花費與結果,包含真實的踩坑和觀察,是高品質的實作心得。
Tony Bai 分享個人技術博客從 WordPress 遷移到 Hugo 的實錄,如何利用 AI Agent 在兩天內完成,這是一個關於利用 AI 進行實際工作流程改造的範例。
r/LocalLLaMA 社群發起討論,詢問大家希望發現的、能節省時間或提升本地 LLM 使用效率的工作流程,匯集了 RAG、MCP、coding agents 等多種實戰應用,有助於了解實用的工作流。
Fireworks AI 提出使用開放源碼 worker agent 結合閉源 advisor model 的方法,能在更低成本下提升效能,並提供了具體的基準測試結果,是關於成本效益優化工作流的實戰分享。
討論 AI agent 在偵測應用凍結問題時的局限,並提出使用 profiler 工具作為解決方案,是具體的踩坑與實作經驗分享。
深入分析 Claude Code, Codex CLI 等 CLI 工具爆發的原因,指出 LLM I/O、任務可控性、跨工具協作是結構性驅動力,並附有 Claude Agent SDK 的實操範例,對 CLI 工具開發者和使用者非常有價值。
分享如何建立雲端軟體工廠,利用 agent 和 loop 自動化開發流程,具體闡述了工作流方法論。
作者分享讓 Claude Code 寫程式碼,再讓 Codex 進行審查的雙模型工作流,發現 Codex 在找出錯誤方面表現更好,提供了一個具體的模型協作審查範例。
使用者分享使用 Claude 進行約會計畫的執行階段,包含模型選擇、目標受眾建模和時間規劃,展示了 AI agent 在個人專案中的應用。
針對 Loop Engineering 的驗證債、理解債、認知投降問題,提供了實戰治理的 playbook,包含 Wharton 實驗、Anthropic 數據、Claude Code 的 PreToolUse hook 設計等。
提出「Prompt Debt」問題,指出原型設計中的簡單提示在長期維護中會變成系統負擔,需要更系統化的方法。
介紹了一個代理 (proxy) 程式,能在將提示傳送給 LLM 前進行清理,包括聚類冗餘句子、清除敏感數據,並強制執行規則,聲稱可節省 60% 的 token 費用。
作者分享如何使用 Claude 的 $20/月方案,在46天內從零基礎學會程式設計,並成功搭建了一個 SaaS 平台,強調了正確提示結構的重要性。
探討如何透過路由任務到正確的模型來優化 AI 成本,提出實用的成本控制策略。
Armin Ronacher 探討 'loop' 的概念,並引用 Boris Cherny 的觀點,強調由 'loops' 驅動 agent 的趨勢,對 agentic workflow 有啟發。
分享如何建立自動化回饋循環來優化 agent 的 Skill,有具體步驟和概念解釋,價值很高。
分享使用 Claude Code 逆向工程汽車數據的實戰文章,包含工具整合與方法論,對感興趣的開發者有價值。
分享 Bonsai 這款 Mac App,用於空間化的腦力激盪、精煉想法和提示 agent,解決了資訊分散的問題,提供了一個創新的 agentic workflow 設計。
分享 unslop-text Claude skill,用於移除 AI 生成文本的模式,基於 Reddit 數據分析,有實際工具和數據支持。
分享使用 Claude Code agents 並行建造一個中世紀農民模擬遊戲的經驗,重點在於測試方法,包含無瀏覽器運行和 AI 視覺評估,是複雜專案的實戰案例。
作者提出將 AGENTS.md, CLAUDE.md, 和 memory 整合為 AI 專案的「專案護照」,讓 AI 在每次會話開始時快速驗證專案身份和規則,解決了跨會話重複介紹專案的問題,是非常實用的工作流程優化分享。
與 #31 重複,Simon Willison 探討 Prompt Injection 的「Role Confusion」角度,是高價值的 Prompt Engineering 討論。
Jason Liu 分享如何使用 Codex 處理長時間工作流,包含保存上下文和管理複雜專案,是具體的實作心得與工作流分享。
Simon Willison 分享如何使用 Claude Code 在瀏覽器中運行 Moebius 模型,是實際的工具整合與實作案例,具體且有教學價值。
Simon Willison 深入探討 Prompt Injection 的「Role Confusion」角度,結合研究論文與獨立觀點,是高價值的 Prompt Engineering 討論。
討論 AI 摘要是在寫入時預先生成,還是查詢時即時生成,分析了兩者的優缺點,對構建知識庫和 RAG 系統有實際的設計決策參考價值。
作者反思一年來建構 LLM 產品的經驗,從原先對全自動 Agent 的看法轉變為更務實的設計原則,包含窄範圍、明確標準、盡量少用循環、結構化輸出、人類批准等,是非常高價值的實戰經驗與方法論分享。
作者開發了 gwen-digestor,一個 MCP server,能在 CPU 上透過壓縮對話內容來減少 LLM 的 Token 使用量,並提供具體的壓縮效果數據,是 CPU 黨必看的高價值實戰技巧。
r/cursor 用戶尋求如何讓 Cursor 生成更優質、更具設計感的 UI,並列舉了對標的產品,探討了 prompt engineering 和 AI 在 UI 設計中的具體應用方法。
作者基於 Git 的概念,開發了一個本地化的 Prompt 版本控制系統 promptrepo,能夠追蹤 Prompt 的變更、比較、評估成本和延遲,對於需要管理複雜 Prompt 的開發者來說,是實用的工作流工具。
這篇文章深刻指出,許多 Prompt 的失敗源於 Context 的不足,而非 Prompt 本身,強調提供任務、受眾、來源、約束和定義好的輸出,並讓模型進行自我驗證,是極具實戰價值的 Prompt 工程心法。
作者分享了超過 30 種語言的 Prompt Injection 防禦模式,並開源了數據集,對於關心 LLM 安全的開發者來說,這是一個極具價值的研究和實踐資訊。
作者分享了自己成長於各大平台的 AI Prompt 和系統,用於產生能有效吸引觀眾的 hook,直接點出 AI 在內容創作工作流中的實戰應用,並包含具體方法。
作者開發了一個本地化的 Prompt 變體比較工具 Prompt Tournament Runner,讓 Prompt 工程師可以系統性地評估和選擇最佳 Prompt,避免盲目試錯,是針對 Prompt 迭代工作流的絕佳實踐。
作者分享了如何使用 Prompt Engineering 技巧,讓無狀態的 VLM 實況評論聽起來更像人類,儘管面臨挑戰,但探討的技術點(Persona rotation, style-specific prompts, deduplication)對社群直播、內容生成等有實際應用價值。
Eric 部落格提供 12-Factor Agents 教學手冊,詳細更新了 Agent 工程的演進,包含 DAG Orchestrator 和 Pre-fetch Context 等原則,對 Agent 架構師和開發者有極高的實作指導價值。
Han-chung Lee 探討 AI 系統的隱藏技術債,特別是 Agent 的評估基礎設施,強調實驗性設計而非僅僅運行基準測試,有助於開發者建立更可靠的 AI 系統。
Qodo Blog 分享如何確保 AI 生成的程式碼能安全上線,強調生產環境的可靠性,包含 idempotency, retry bounds, auth checks 等,有高度的實戰價值。
深度分析 Anthropic 40 萬筆真實對話數據,證明 AI 時代專家經驗的價值反而提升,並非商品化,具有獨到見解和實證支持,是方法論的頂級內容。
作者分享利用 Fable 5 創建一種新的程式語言(NeedleScript)的過程,並逐步改進,展現了 AI 在創造性編程和語言設計方面的實戰應用和探索。
作者使用 Claude Code 和 Codex 構建 GTA 線上複製品,玩家可透過 prompt 產生內容,屬於深度實戰工作流分享,展現 AI 在遊戲開發中的潛力。
作者分享利用 Claude Code 追蹤任務列表、清理試算表等非編程類任務的習慣,這些看似簡單的應用節省了大量時間,是寶貴的實戰經驗。
Loop Engineering 教學手冊,包含 Harness Engineering、Agent 工作流、Evals 設計等,適用於資深工程師,提供系統性的方法論和實戰細節。
引用 Charity Majors 的觀點,指出 AI 顛覆了程式碼生產的經濟學,使程式碼變得可消耗,這對理解 AI 時代的軟體工程有深刻啟示,是方法論層面的重要思考。
探討在 AI 編碼時代為何選擇 Go 而非 Rust,指出 AI 降低了寫程式的門檻,但提高了讀寫維護的成本,Go 的簡單性成為優勢,提供了對現代軟體工程選型的深刻見解。
分享一個創新的 Prompt 工程技巧:讓 LLM 在寫作前先透過提問來深入理解需求,能產出比直接下指令更好的結果,是實用的工作流程分享。
分享了縮短產品照 Prompt 長度、從長篇大論轉向精簡指令反而效果更好的真實經驗,是寶貴的 Prompt 工程實戰心得。
電腦玩物分享如何利用 ChatGPT 打造 AI 團隊,管理多個 AI 員工的實戰流程,提供具體的指令和管理技巧,對個人和小型團隊很有幫助。
Vicki Boykis 分享了在 Mac 上運行本地模型的實際經驗,並列舉了 Mistral 7B、Gemma 3 等模型,強調了本地模型現在的可用性。文章提供了真實的使用心得和模型評估,非常符合使用者對實作技巧的需求。
文章強調,即使是 LLM 驅動的工具,仍然需要領域知識來捕捉和呈現。這對開發者來說是重要的實戰提醒,即技術之外的知識積累同樣關鍵。
Georgi Gerganov 分享了他在日常開發中,使用 Qwen3.6-27B 處理程式碼任務的經驗,雖然是小任務,但體現了本地模型在實務中的應用價值和對開發者的幫助。
Tony Bai 報導了 Google DeepMind 在自動化 Agent Harness 方面的研究,指出 AI 已能自己編寫 Harness。這項研究顛覆了以往手動構建 Harness 的模式,對未來的 Agent 開發方法論有重大影響,是高價值的實踐指導。
作者分享了用於 LinkedIn outreach 的 GPT prompt 結構,包含多階段訊息策略,避免聽起來像機器人,並展示了實際運作有效的流程,是高品質的 prompt 工程實戰分享。
作者分享一套 6 部分的 prompt 結構(角色、目標、核心任務、工作方法、規則、輸出規格),用於解決輸出通用問題,包含具體範例,是非常實用的 prompt 工程方法。
作者觀看大量 AI Agent 教學後,總結出實際重要的部分在於模型架構(如上下文文件、記憶體、MCP 連接、可複用技能),而非模型本身差異,並提到技能的 Token 成本,提供非常具體的實戰洞察。
作者分享免費 prompt 建構工具,展示如何使用 9 種框架(如 CoSTAR、RTF)將簡單 prompt 提升至專業級,並提供具體範例,是高品質的 prompt 工程教學。
作者分享使用 Claude Code 建立一個能讓 Claude 自承錯誤的技能,並描述了開發過程與踩坑經歷,例如 Claude 報告已完成但實際上未完成的任務,非常有實戰價值。
作者分享了一個 prompt,要求 AI 在給出答案前先展示閱讀、提問、連結、排除的思考過程,旨在減少 AI 的臆測,是直接的 prompt 工程技巧分享。
Stephen Bochinski 分享在家中經濟實惠地進行 AI 編碼的經驗,包含硬體設置與模型選擇,對個人開發者有極高的實戰價值。
深度解析 Gemini Managed Agents 的內部運作機制,包含 sandboxing、skills 加載與模型循環,對於想實作 Agentic Workflows 的開發者有高度實戰價值。
分享了 LinkedIn Thought Leadership prompt 的結構,強調具體要求(如語氣、開頭、數字),並附上實際應用案例與成效,對社群媒體內容創作有實戰幫助。
r/cursor 社群用戶分享他們使用 Cursor agent mode 的工作流程,包含創建分支、規劃、實施、切換 agent 等具體步驟,以及遇到的困難,對其他用戶學習和優化 agent workflow 極有幫助。
作者分享如何用 Rulemapping 方法論處理複雜 prompt 邏輯,並為此開發了 Rulemap editor,旨在提高 prompt 的可維護性,對 prompt 工程師有實用價值。
作者分享使用 Claude 專案時,發現 prompt engineering 的效果有限,而 context engineering 才是關鍵,包含具體的踩坑過程與經驗,極具實戰價值。
深入探討 Context Engineering 的重要性,主張其優於 Prompt Engineering,並說明如何建立資訊生態系統以提升 AI 效能,包含具體方法論與概念解析,實戰價值極高。
作者聲稱 reverse-engineered ChatGPT 的 'reasoning',發現一個使其更聰明的 prompt 模式,即要求模型先「展示工作過程」,提供具體的技巧與發現,實戰價值高。
獨立作者分享親身測試 200+ prompt 後,篩選出 5 個能實際改變工作流程的 prompt,並提供具體範例,實戰價值高。
r/cursor 用戶分享在使用 Cursor 時,管理 context 的時間佔比過高,並提出對本地 repo 監控工具的需求,這直接點出了 Cursor 實戰使用中的效率瓶頸和改進方向,是寶貴的使用者經驗。
作者開源了 zero-ratchet 工作流,用於提升 AI 程式碼代理的多步驟軟體開發流程可靠性,包含階段劃分、角色分離與明確的 gate 機制,實戰價值高。
作者開發了 Ghost in the Loop 工具,用於自動化多步驟 AI 對話,減少人類干預,並尋求社群測試與回饋,對優化 AI 工作流程有實戰價值。
Hacker News 連結了一篇關於如何在 macOS 上設置本地 coding agent 的教學。這提供了具體的設置步驟和方法,對想在本地運行 agent 的開發者非常有幫助。
Kilo Code Blog 測試 Grok Build 0.1 在真實 agentic coding 任務中的表現,試圖從 Git 歷史中恢復一個秘密。這是一個具體的 agentic coding 任務測試。
陳廣亮的文章探討了 Loop Engineering,認為它不是取代 prompt engineering,而是將重點從『按回車的人』轉變為『設計循環的人』,並解釋了其五個組件和一個 state。這是一個關於 agentic workflow 設計的高級方法論分享。
Rectangle Health 使用 Oz 建立一個自我改進的 AI 協作夥伴,從問題分類到合併 PR,能自動化大量程式碼編寫。這是一個優秀的真實世界工作流程分享。
Reddit 社群成員為 Claude Code 設計了一個『懶惰資深開發者』模式(Ponytail),顯著減少了不必要的代碼生成。這是一個非常具體的 prompt engineering 技巧,用於控制模型行為並提高效率。
Reddit 社群分享了一個『canary』機制,利用 Claude 故意設定一個無用的規則,來偵測模型何時開始性能下降並『發明 API』。這是一個非常巧妙且實用的 prompt engineering 技巧,用於監控模型行為。
陳廣亮分享 Claude Fable 5 API 集成需要修改的 5 件事,包括 stop_reason refusal、adaptive thinking、fallback 模型機制,是具體的實作與踩坑分享。
Simon Willison 分享 Claude Fable 5 的實作心得,強調其 proactive 特性,並以具體案例說明,非常符合高優先級。
彙整了 8 種 prompting techniques,7 個 key terms,10 個 frameworks,12 個 best practices,是全面性的 prompt 工程指南。
開發者分享從憑感覺調整 prompt 到建立評分迴圈來優化 prompt 的系統化方法,包含 test cases 和 scoring,是高價值的實作經驗。
開發者分享使用 Claude Code 建立 autonomous agent 來維護開源應用的實驗,涉及 prompt 設計和 code generation。
分析 image model character consistency 的 prompt 工程限制,並提出 training Lora 的解決方案,是深入的實作經驗分享。
KiloBench 質疑了僅僅依賴基準測試分數的評估方式,強調了在實際產品環境中的有效性。這對於評估 AI 模型和工具的實戰價值提供了重要的視角。
這是一篇關於如何構建能抵抗工具變化的 AI coding workflow 的深度文章,強調了多表面、多模型 workflow 的重要性,符合高優先級的實作技巧和工作流分享。
這篇文章展示了一個 Agent 如何透過串聯 Hugging Face Spaces 構建一個 3D 畫廊,這是一個具體的 agentic 工作流範例,展示了如何利用現有工具組合來完成複雜任務。
Simon Willison 分享了他如何使用 micropython-wasm 創建一個安全的程式碼執行沙盒,並用於 Datasette Agent,這是一個關於安全程式碼執行的實作方法。
Simon Willison 分享了他如何使用 Claude Fable 5 reverse-engineer 了 AgentsView 的價格設定,並在 AgentsView 中設定自訂模型價格。這是利用新模型進行工具探索和客製化的實作案例。
作者分享 Claude 如何加速原型開發,並提及 Lyzr AI 等工具,強調了 AI 工具生態系統的協同作用,是寶貴的實作經驗分享。
分享如何 100% 基於 Claude AI 構建一個機器人專案,包含硬件選購、組裝和程式碼編寫,是絕佳的實作經驗與踩坑分享。
探討受監管組織如何讓工程師使用 Claude Code/Copilot,考慮到數據安全問題,提出 VPC 代理、自託管模型等方案,是關於企業級 AI 應用落地的重要討論。
作者測量 Claude Code 在讀取檔案和命令輸出上浪費的 token 數量,並提出 OSS 工具來優化,提供了具體的 token 效率優化方案。
分享 7 個將 prompt engineering 變成工作習慣的技巧,包含提供 failure mode、定義受眾等,是極佳的實作方法論分享。
Reddit 用戶分享他使用 Claude Code 創建了一個模擬 150 種科技人物特徵來壓力測試 pitch 的 Skill,展示了 AI Agent 在特定應用場景下的創造性用法。
Reddit 用戶分享使用 Claude Code 開發個人專案的樂趣,強調了開發小型、個人化應用的價值,屬於獨立作者的心得分享。
Reddit 討論如何在 Claude.ai 的 brainstorming 階段與 Claude Code 之間有效傳遞 context,避免 copy-paste 的損耗,尋求實用的工作流解決方案。
Reddit 用戶探討 Claude Code 產生的「已完成工作」的幻覺,以及驗證問題,分析了 AI Agent 在程式碼審查中的挑戰,是寶貴的踩坑經驗。
文章探討了 Agent Harness 的隱藏技術債,包括系統提示、工具包裝、規劃執行循環等,並指出好的團隊會建立大量 Harness,這對開發者來說是重要的實戰考量。
作者分享了紅隊測試 AI Agent 的經驗,列舉了所有成功的攻擊方式,並提出了解決方案,這對提高 AI Agent 的安全性具有極高的實戰價值,符合使用者對踩坑與分享的偏好。
詳細分享結合 Claude Code 和語音輸入的工作流程,實際用在步行時的生產力提升,是高價值實戰分享。
分享週末建構的 LLM Observability 平台 LogLens,能記錄 AI 呼叫、成本和延遲,並整合 Claude 等,對開發者管理 AI 應用有極大幫助。
分享建構 Claude Agent 團隊的流程和工具 (clem),屬於 Agentic 工作流實戰。
分享利用 Living Spec Doc 作為 AI 記憶,解決 LLM 持續性問題,是高價值的 Prompt Engineering 和工作流方法論。
PM 無程式背景,用 Claude 2.5 個月開發 iOS App 的全流程經驗分享,含踩坑和工作流,非常實用。
介紹 DSPy 框架,透過演算法優化 LM prompt,為 Prompt Engineering 提供新的方法論。
Simon Willison 分享 Charity Majors 對 AI 領域動態的觀察,強調 AI 帶來的真正能力飛躍,屬於對 AI 實戰趨勢的深度思考與總結。
使用者開源了一個本地多代理框架 Munder Difflin,讓 Claude Code agents 在模擬環境中運行,這是一個關於構建複雜 agent 系統的深度實作分享。
使用者分享 Cursor agent 虛構文件路徑的問題,並強調了 AI 產生誤導性資訊的風險,是關於 AI 實戰中的踩坑與注意事項。
Cursor 分享使用多代理系統優化 GPU kernel 的實際案例,達到顯著效能提升,是高度實戰的應用分享。
Cursor 介紹透過即時 RL (Real-time RL) 改善 Composer 模型,利用真實推理 token 進行訓練,這是對 AI 模型訓練方法論的深入探討。
用戶分享如何將 Claude Code 和 MCP 協議結合,查詢 Polymarket 資料庫,並提出問題讓 Claude Code 自己寫查詢語句,這是非常具體的 AI agent 實戰應用與工作流。
用戶分享使用 Claude Opus 4.8 從零開始建立一個 2D 平台遊戲的過程,並展示了如何透過迭代反饋來不斷完善,這是 AI 輔助創意專案的極佳實戰案例。
一位獨力創業者分享如何利用 Claude 作為 SEO 團隊,分析數據、生成內容、撰寫程式碼修復,並取得顯著成效,這是非常實用的 AI 工作流分享。
一位全盲使用者分享如何利用 Claude Code 輔助進行 3D 設計,克服了傳統設計工具與螢幕閱讀器之間的障礙,是 AI 輔助無障礙設計的精彩實戰案例。
探討 GitHub trending 的 'skills' pack,質疑其是否為真正的 prompt engineering,並分析了 Andrej Karpathy 和 mattpocock 的技能集,這對理解如何組織和利用 AI agent 能力有實戰啟發。