OpenAI推出新一代语音转录模型

Source

品玩7月29日讯,据 explainx.ai 报道,OpenAI近日发布了新一代语音转录模型系列,旨在为开发者提供更符合实际应用场景的解决方案。此次更新将转录任务明确划分为实时与异步两种模式,并推出了对应的推荐模型。

新系列包含两款核心模型:gpt-live-transcribe专为麦克风、通话等实时音频流设计,提供低延迟的实时转录能力;gpt-transcribe则适用于处理已完成的录音文件或批量任务。OpenAI建议,大多数新项目应优先采用这两款模型,而非旧有的Whisper或gpt-4o-transcribe路径。

两款新模型均支持通过prompt(自由文本)、keywords(关键词)和languages(语言列表)等参数输入上下文信息,以增强在口音、专业术语及嘈杂环境下的识别准确率。官方测试显示,引入上下文后,gpt-transcribe的语义准确率得到显著提升。