尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

炸裂!我用 Gemini 新模型给英雄联盟解说做实时字幕,语速再快也没翻车!(附开源代码)

炸裂!我用 Gemini 新模型给英雄联盟解说做实时字幕,语速再快也没翻车!(附开源代码) 电竞解说实时转写向来是业内难啃的「硬骨头」——超快语速、高密度的黑话和选手 ID叠加激烈的游戏背景音对模型的识别能力和延迟解决方案是全方位的极限考验。Google 今天正式发布了 Gemini 3.5 Transcribe。和 Gemini 系列之前的产品定位不同这不是一个通用多模态模型而是一个独立的专用转写模型只负责语音转文字。目前 Gemini 3.5 Transcribe 已经在 Google 自己的多个产品中上线包括 Gboard 上的 Rambler 语音输入、macOS 版 Gemini 应用的 Speak to Window 功能以及 Chrome 浏览器的语音输入中。开发者可以通过 Gemini API 和 Google AI Studio 使用。Agora 作为本次发布的官方合作伙伴之一已经完成了对 Gemini 3.5 Transcribe 的集成支持开发者也可以在 Agora Conversational AI 中直接进行调用。两个模型两种用法Gemini 3.5 Transcribe 包含两个模型对应不同的使用场景gemini-3.5-transcribe-live走 Live API做实时流式转写。音频边输入文字边输出延迟在亚秒级。适合直播字幕、语音 Agent、实时会议纪要这类需要即时响应的场景。gemini-3.5-transcribe走 Interactions API处理预录音频。支持说话人分离最多 3 人3 人以上为实验性支持和词级时间戳适合会议录音整理、通话质检、播客转录这类对实时性要求不高但需要结构化输出的场景。转写模式VERBATIM 和 SMART两个模型都支持 VERBATIM 和 SMART 两种转写模式通过mode参数切换。VERBATIM是逐字转写。用户说了什么就输出什么对 “嗯”“那个”“啊不对”等语气词和口头禅都会进行保留。该模式适合需要保留原始发言的场景比如法律记录、语音数据标注。SMART则会在转写的同时做文本清洗去除语气词和口头禅“嗯”“呃”“你造”修正口误和自我纠正用户说“煎饼果子不对烤冷面”输出结果只保留“烤冷面”自动补全标点、大小写和段落分隔格式化数字、日期、货币、电话号码等结构化内容举个例子当用户口述“我邮箱是 San dot Zhang at RTE dot com”时SMART 模式直接输出san.zhangRTE.com。需要注意的是SMART 模式和词级时间戳、说话人分离互斥不能同时开启。如果业务上同时需要干净文本和时间戳需要在应用层做两次调用。性能参数准确率WER非流式 2.6% 的 WER 意味着每 100 个词中平均只有不到 3 个词转写有误多数句子可以直接使用该成绩在 Artificial Analysis 排名中位列第 5。流式 4.0% 略高但流式比非流式高 1 到 3 个百分点是 STT 行业的普遍情况。速度相比上一代 Chirp 3time to final transcription 提升约70%。对实时场景来说这意味着字幕出现得更快语音 Agent 能更早开始响应用户感知到的对话等待时间会明显降低。上下文窗口96k输入 token32k输出 token大约覆盖一小时音频。开启说话人分离或词级时间戳时上限降到 30 分钟。其他能力自定义词表最多 1000 个词条建议 100 个以内效果最佳语言支持85 语言自动检测支持句内语言切换Function calling转写模型原生支持可在转写同时触发函数调用定价参考第三方估算约$0.005/分钟非流式和$0.009/分钟流式具体以 Google 官方定价页为准。社区实践给电竞直播加实时 AI 字幕除了对话式 AI 中能够使用 Gemini 转写在传统的直播中也能通过增加语音实时转写让直播更精彩。模型发布后社区中有开发者基于 Agora RTC 和 Gemini 3.5 Transcribe Live 做了一个 MatchCast 的开源项目给英雄联盟的比赛直播加实时字幕。电竞解说是一个比较极端的转写场景语速快、游戏术语和选手 ID 密度高、背景有游戏音效。从实际运行效果看配合自定义词表之后大部分英雄名和选手 ID 能够正确识别字幕延迟在可用范围内。该开源项目完整展示了 Gemini 3.5 Transcribe Live 在实际直播场景中是怎么如何应用的如果你也想复刻一个刺激的电竞解说以下为具体教程。GitHub 链接https://github.com/zicojiao/agora-matchcast架构概览直播源 (OBS / 本地视频) | | RTMP 推流 v Agora Media Gateway | vAgora RTC 频道 ────────── Next.js 播放器视频 原始音频 | v Python 音频订阅端16kHz 单声道 PCM | v Gemini 3.5 Transcribe Live | | 字幕文本 v Agora RTC 数据流 ────────── 浏览器叠加显示字幕直播源通过 RTMP 推送至 Agora Media Gateway进入 RTC 频道。浏览器加入同一频道接收直播画面。同时一个 Python 服务也加入该频道订阅直播源的音频流将其转换为 16kHz 单声道 PCM 后发送至 Gemini。Gemini 返回的字幕文本通过 Agora RTC 数据流回传至频道浏览器接收后叠加显示在视频画面上。前端使用 Next.js后端使用 Python FastAPI。所有 API key 均在服务端管理浏览器端不直接连接 Gemini。本地运行安装依赖# 前端 pnpm install # 后端 cd server python -m venv .venv source .venv/bin/activate pip install -r requirements.txt cd ..配前端环境变量cp .env.example .env.localNEXT_PUBLIC_AGORA_APP_ID你的 Agora App ID NEXT_AGORA_APP_CERTIFICATE你的 Agora App Certificate NEXT_PUBLIC_LIVE_CHANNEL_NAMEmatchcast-live NEXT_PUBLIC_MATCH_FEED_UID234567 AGENT_BACKEND_URLhttp://localhost:8000 BACKEND_API_SECRET用 openssl rand -hex 32 生成一个前后端共享配后端环境变量cp server/.env.example server/.env.localAGORA_APP_ID你的 Agora App ID AGORA_APP_CERTIFICATE你的 Agora App Certificate MEDIA_UID234567 BACKEND_API_SECRET和前端同一个 GEMINI_API_KEY你的 Gemini API key GEMINI_TRANSCRIBE_MODELmodels/gemini-3.5-transcribe-live GEMINI_LANGUAGEen-US GEMINI_TRANSCRIPTION_MODEsmart前后端的 Agora Certificate 是同一个值环境变量名不一样是因为 Next.js 和 Python 命名习惯不同。启动后端cd server source .venv/bin/activate uvicorn app.main:app --reload --host 127.0.0.1 --port 8000启动前端pnpm dev打开 http://localhost:3000。推直播流Agora Media Gateway 需要 RTMP server 地址和 stream key。先在 Agora Console 里启用 Media Gateway然后用项目里的脚本生成 keypnpm run media-gateway:key推送本地视频RTMP_STREAM_KEY生成的 key \ RTMP_INPUT/path/to/your-clip.mp4 \ STREAM_ONCE1 \ pnpm run stream:sample移除STREAM_ONCE1可实现循环播放。也可使用 OBS 推流填入相同的 server 地址和 key 即可。此时浏览器中应已显示视频画面点击开始后字幕将实时出现在画面上。可配置项自定义词表电竞解说中专有名词密度较高如不提供自定义词表模型难以正确识别。在后端环境变量中配置GEMINI_VOCABULARY_MODEcustom GEMINI_TRANSCRIBE_VOCABULARYFaker,T1,Cloud9,Shockwave当前 demo 已内置了一些英雄联盟的常用词开发者可根据实际场景自行替换。转写模式默认为SMART想要逐字转写改成GEMINI_TRANSCRIPTION_MODEverbatim。字幕延迟调参GEMINI_TRANSCRIBE_ACTIVITY_MIN_MS5000 GEMINI_TRANSCRIBE_ACTIVITY_MAX_MS6000 GEMINI_TRANSCRIBE_ACTIVITY_HANDOFF_SECONDS1.5这些参数控制音频活动检测的时间窗口。缩短窗口会提高字幕更新频率但可能导致文本碎片化增大窗口则输出更完整但延迟略高。项目中提供了 CSV 导出功能每条字幕均记录了浏览器端的延迟数据便于对比不同配置的效果。部署前端可部署至 Vercel后端可部署至 Railway仓库中已包含 Dockerfile。线上部署需注意前后端使用同一个BACKEND_API_SECRETAGENT_BACKEND_URL指向线上后端地址API key 和 Agora Certificate 仅在服务端配置 Voice Agent 学习笔记了解最懂 AI 语音的头脑都在思考什么
返回列表