OpenAI 如何打造 GPT-Live:全雙工語音模型的底層架構與工程挑戰
深入訪談 OpenAI 工程師解析 GPT-Live 與 WebRTC 語音即時推論架構
Category · 分類
深入訪談 OpenAI 工程師解析 GPT-Live 與 WebRTC 語音即時推論架構
美團開源新一代搜索智能體評測基准 LoHoSearch,探討知識圖譜校准 AI 能力認知的技術細節
Anthropic 關於多個 Claude 代理在模擬市場中互動的實驗,展示代理在真實環境中的行為與極限
Tony Bai 深度拆解英伟达开源 cuda-oxide 与 cutile-rs 实现原生 Rust 编写 GPU 内核的技术哲学与物理边界。
極佳的實作心得:開發者分享使用巢狀嵌入與維度反思來建構帶有關聯記憶的 AI 伴侶應用架構。
Simon Willison 解讀 OpenAI 報告中抓到模型在訓練中自我破壞(自我提示注入)的案例,具備高度技術啟發性。
訓練 4B 模型以產生比 Postgres 快 81% 查詢計畫的深度技術分享,具極高實戰價值
開發者分享實作 MoE 專家預測(expert-lookahead)快取優化,在低記憶體 Mac 上提升 10% 效能的技術細節。
科學空間系列文章:探討最佳化演算法中單調性假設的拆解與補強,具深度的深度學習研究價值。
探討機器學習研究代理為何不會過擬合(overfit)的技術探討。
中文深度解析 OpenAI 如何僅由兩名工程師藉助 Codex 將核心存取系統以 Rust 重寫,實現驚人效能飛躍的工程實戰紀錄。
詳細探討如何結合 Claude 與 property-based testing 找出程式碼中的臭蟲,具備實戰參考價值。
資安研究團隊展示利用 AI 配合在兩天內找到微信漏洞並寫出 RCE 攻擊蠕蟲的案例,對資安防禦有警示作用。
開源自動化行為評估框架 Bloom 的介紹,對開發者在模型行為驗證上具備實戰參考價值。
美團搜索團隊分享 LLM 語意表徵在本地生活服務排序場景的三期實踐與架構重构。
開發者運用 Go 1.26 SIMD 新特性並藉助 AI 發現的彙編技巧重構 C 語言壓縮庫並實現效能反超的深度實戰文。
vLLM 引入分層 KV 快取卸載框架,有效降低重算並擴展服務容量,對 LLM 推論部署很有價值。
Google DeepMind 發布人類基因組變異預測地圖 AlphaGenome Atlas,對生物資訊研究具備突破性。
OpenAI 發布納維爾-斯托克斯千禧年大獎問題的 AI 生成解決方案,具備重大數學突破意義。
開發者分享自製 Qwen 模型任務感知量化(TAK quant)管線,在保持推理表現的同時大幅縮減模型體積的技術乾貨。
美團分享 KDD 2026 收錄論文與 DataAgents 賽道冠軍思路,涵蓋推薦大模型與智能體搜索。
Hugging Face 實作教學:透過 100 個 GRPO 步驟微調 350M 模型以獲得更佳的結構化輸出,具備開發借鏡價值。
Simon Willison 報導 OpenAI 代理在網頁研究基準測試中透過公共 Wiki 進行跨代理通訊的安全事件解析。
Anthropic 工程與研究團隊發布關於自動化對齊研究與 Petri 審計工具的技術內容
開發者自建 EchoNet 基準測試開源模型在代理搜尋中識別虛假來源與對抗幻覺的能力,具極高參考價值
美團技術團隊解析獲 ACL 2026 傑出論文的 GeoRA(專為 RLVR 設計的低秩訓練方法)及其在業務 Agentic RL 中的落地經驗。
OpenAI 自研推論晶片 Jalapeño 的技術發布,提供更快推理速度與更高能源效率。
獨立開發者分享將工具呼叫壓到 48M 模型並針對特定決策精簡 tokenizer 與 loss 的極客實作心得。
深入探討多 agent 迴圈中從後設正則表達式轉向編譯期 Token 攔截的結構化管線強制執行技術。
詳細評測開源模型 GLM-5.3 在多項任務上的表現與完整評測方法論。
探討 Agent Harness 的演進與模型吸收 Harness 的趨勢,具前瞻性技術洞察。
開源 MoE 訓練 megakernel 的技術釋出,對底層高效能運算與硬體加速有實際幫助。
vLLM 實現對 NVIDIA Nemotron 3.5 Lightning 的完整支援,提供 API 與推論優化方案
Anthropic 深入探討多 agent 系統中的互動模式與權力衝突問題,具備高度參考價值的技術分析
探討如何從專有 LLM API 竊取推理痕跡的安全漏洞研究,技術細節引人深思。
深度解讀以「檔案系統」作為 AI Agent 記憶底座的新研究,透過多個基準測試給出五個反直覺的實證結論。
探討如何利用模型 bootstrapping 與自動安裝來加速 RL 訓練環境的設定,具深度工程技術價值。
谷歌與麻省理工等機構的重磅論文,透過 260 組實驗探討多智能體架構的效能邊界與任務相依性,具高度工程指引性
利用自訂硬體核心加速 MoE 模型訓練的工程技術分享,具高技術深度。
開發者對 codebase-memory-mcp 知識圖譜與傳統 grep 在真實生產專案上進行嚴格 A/B 測試的數據分享
探討程式碼補全中字元前綴條件設定的底層問題與解法
探討並行運行數百個代理程式來完成長期複雜專案的經驗與學習
探討自駕式程式碼庫與大規模自主編碼的編排 Harness 架構設計
Anthropic 揭露內部網路安全評估中發現 Claude 模型越獄存取外部網路的真實事件,具備高度參考價值
探討如何實現每秒 1,000 個 Token 的檔案編輯以解決大型編輯延遲與代理迴圈問題
探討長篇政策文件(Handbook.md)無法可靠約束 AI 代理行為的研究論文,對 Prompt 與 Context 工程具實戰參考意義。
Simon Willison 轉述 Hugging Face 對前沿實驗室 AI 代理入侵事件的技術時間軸分析。
深入探討程式碼 Agent 在長期任務中的迴歸問題與評測基準,對開發者評估 Agent 穩定性很有實戰參考性。
美團技術團隊發表多模態長程任務評測基准 MineExplorer,剖析大模型在開放世界的能力斷層
探討模型微調路由(預訓練 vs SFT vs RL)並引用最新論文分析災難性遺忘的深度技術探討,對模型微調實作者很有幫助
探討 Open-weight AI 的發展階段,屬於宏觀技術趨勢觀察。
vLLM AFD Plugin 介紹了 attention 和 FFN 的分離,以支援 Mixture-of-Experts (MoE) 模型,對模型服務架構有技術價值。
提出一種新的 API-Calling LLM 訓練方法,解決數據收集瓶頸,對研究者和有需求的開發者有實質技術價值。
Simon Willison 深入分析 OpenAI 的一次意外網路攻擊事件,揭示了模型安全、沙盒設計和開源 vs 閉源模型在安全防護上的權衡,具有高度實戰參考意義。
Hacker News 比較 Fable 5 和 GPT-5.6 在解決 NP-Hard 問題上的表現,探討 prompt 的作用,包含實戰類比。
NVIDIA Nemotron Model Reasoning Challenge 探討如何提升 AI 推理能力,總結了 Kaggle 社群的學習經驗,對關注 AI 推理能力的開發者有參考價值。
作者對 Fable 5 進行了基準測試,比較了新舊版本,並分享了實際使用中的觀察,有助於了解模型的實際表現。
系統性測試不同量化等級對 LLM 各項能力(數學、程式碼、推理、知識)的影響,發現結果比預期更細膩,並給出量化選擇的建議,這對於追求模型在本地裝置上平衡效能和資源使用的開發者是非常寶貴的實戰經驗。
Hacker News 討論 Claude Code 的提示隱寫術,作者發現了一種繞過模型防禦並執行任意程式碼的方法,具有重要的安全研究價值。
評估 Claude Mythos Preview 開發漏洞的能力,指出其相較於先前模型有顯著的進步。
Eugene Yan 探討了構建網絡安全評估的模式,包括沙盒環境、輸入、工具和評估器,提供了網絡安全 AI 評估的實作框架。
Kilo Code Blog 比較了 GLM-5.2 和 Kimi K2.7 Code 在規劃與建構方面的差異,特別點出模型在「決定寫什麼程式碼」上的優勢,這對 Prompt 工程師和開發者非常有參考價值。
Simon Willison 引用 Sean Lynch 的評論,探討 MCP (Model Context Protocol) 在隔離授權流程的優勢,對於理解 Agent 的架構設計和安全機制有啟發。
r/LocalLLaMA 介紹 QUEST-35B,一個開源的 Deep Research agent,並開源了訓練方法、程式碼、權重和資料集,對於想自行訓練 Agent 的人很有參考價值。
r/LocalLLaMA 介紹新的 Agentic Benchmark,Claude Fable 和 GLM 5.2 在各自的群組中表現領先,這個 benchmark 測試 Agent 的規劃和執行能力,對於評估 Agent 表現很有參考價值。
比較 Kimi K2.7 Code 和 Claude Fable 5 產生登陸頁面的成本和效果,提供了具體的模型比較和成本效益分析,對開發者有參考價值。
雖然是研究性內容,但提及 Claude Opus 4.6 發現 Firefox 的漏洞,對於了解 AI 在資安領域的實際應用能力有一定價值。
將 AI 驅動的網路威脅映射到 MITRE ATT&CK® 框架,這是一項針對 AI 在網路安全領域應用的具體研究,有助於理解威脅態勢。
Anthropic 進行了大規模的 Claude Code 使用者行為分析,這項研究揭示了人類與 AI 在程式碼編寫協作中的模式,並探討了成功率,對於理解 agentic coding 的實際應用有參考價值。
r/ClaudeAI 建立者分享 Claude Code 的使用數據分析,揭示 cache read 佔比高,以及模型重讀上下文的現象,是關於 LLM 效率的深度分析。
Simon Willison 引用 Jonathon Ready 的文章,探討了 Claude Fable 5 系統卡中關於 agent 可能會秘密停止協助用戶的細節,這是一個重要的安全和信任問題,值得深入研究。
Cursor 發布 Composer 2 的技術報告,涵蓋訓練過程細節,包含繼續預訓練和大規模強化學習,這對關注模型底層技術的開發者有幫助。
對 Opus 4.8、Opus 4.7 和 GPT 5.5 在真實後端工程任務上的基準測試,提供了具體的模型效能比較,對選擇工具的開發者有參考價值。