💬 观点Simon Willison
OpenAI WebRTC Audio Session, now with document context — Simon Willison 分享如何利用 OpenAI WebRTC API
Simon Willison 分享如何利用 OpenAI WebRTC API 和 GPT-Realtime-2 模型,在浏览器中实现带文档上下文的实时音频对话。
2026-06-12原文
本文为要点摘要,完整细节以原文为准。
🧭 一图看懂
由原文自动提炼 · 以原文为准点击任一分支,查看这一点的一句话解读
OpenAI WebRTC 音频会话加文档上…
Simon Willison 在旧 WebRTC 音频工具中加入文档上下文功能
- 初版 2024 年 12 月为试用 OpenAI WebRTC…
- 可粘贴大段文档,在浏览器中围绕其进行语音对话
⚙️ 流程拆解
STEP 1打开 WebRTC 音频工具
STEP 2选择 GPT-Realtime-2 模型
STEP 3粘贴文档上下文
STEP 4开始语音对话
🔗 涉及的概念与玩家
- OpenAI公司
- Simon Willison人物
- WebRTC方法
- GPT-Realtime-2模型
- GPT-5模型
- ChatGPT产品
- Simon Willison—构建工具→WebRTC
- OpenAI—推出→GPT-Realtime-2
- GPT-Realtime-2—同级推理→GPT-5
- GPT-Realtime-2—尚未上线→ChatGPT
博主 Simon Willison 介绍了他基于 OpenAI WebRTC API 构建的音频会话工具的更新。
- 整合 GPT-Realtime-2 模型:新版本支持 OpenAI 号称具有“GPT-5 级别推理能力”的 GPT-Realtime-2 语音模型,该模型知识截止日期为 2024 年 9 月。这对开发者意味着,可以在自己的应用中直接利用更强大的实时语音交互能力,而无需等待官方应用更新。
- 引入文档上下文功能:用户现在可以在对话前粘贴大段文档内容,为实时音频对话提供背景信息。这为 Agent 或工具链开发者开辟了新思路,即如何将静态知识库与动态的、多模态的对话流无缝结合。
- 基于 Web 的实时音频交互:整个工具在浏览器中运行,利用 WebRTC 技术实现低延迟的音频流处理。这展示了将复杂 AI 功能(如高级语音模型)集成到轻量级 Web 应用中的可行性,降低了开发者的接入门槛。
原文:OpenAI WebRTC Audio Session, now with document context · 作者 Simon Willison
🕸 顺着图谱继续读
- An Opinionated Guide to Using AI Right Now — AI 使用实战指南:如何根据真实使用场景选择免费或付费模型,并利用深度研究提升结2025-10-19 · 共同涉及 ChatGPT、GPT-5、OpenAI
- Predicting model behavior before release by simulating — OpenAI 推出部署模拟方法,通过真实对话数据预测模型行为,提升安全性和评估准2026-06-16 · 共同涉及 OpenAI、GPT-5、ChatGPT
- How we built a realtime system for responsive voice AI — OpenAI 用六个月构建了低延迟连续语音交互系统 GPT2026-08-03 · 共同涉及 OpenAI、WebRTC
- Claude Cowork and chat are now one Claude — Anthropic 把 Claude Cowork 与聊天合并为单一 Claud2026-09-16 · 共同涉及 Simon Willison、OpenAI、ChatGPT