Google 推出 Gemini 3.8 Live 語音模型,Simon Willison 分享純原生 Web 介面實作

Simon Willison 實測 Gemini Live 語音工具與 Google 新模型的深度心得。

• Google 正式發表全新 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 語音對話模型,主打高互動性的語音對話體驗。 • 開發者 Simon Willison 利用 GPT-6 Astra 分析官方文檔,快速打造出能在瀏覽器中測試該模型的原生網頁介面。 • 該實作完全不依賴第三方函式庫,直接透過 WebSocket API 與 Google 的雙向生成內容端點進行通訊。 • 系統結合了 Web Audio API 的 AudioContext 進行即時聲音擷取與播放,並支援打斷模型發言的功能。

透過底層 API 的直接串接,開發者可以輕鬆建立流暢且具備深度思考能力的語音互動應用程式。


來源:Simon Willison

閱讀原文 ↗

另見:Google DeepMind、Hacker News

← 回首頁