Mozi (@yeahhe) 在 字幕提取这个领域,Gemini 还是太超模了 中发帖
好久没有测试 Gemini 提取字幕的能力了,对 3.8 Flash 这个模型也进行测试
视频时长11分半,不对视频进行切片,一次性导入上下文,多模态分析
第一次 API 调用完成字幕提取
测试一:音频转字幕
拖入音频文件,获取字幕
[PixPin_2026-09-29_01-30-21]
[PixPin_2026-09-29_01-36-54]
镜头这个位置是AI识别出的字幕
完成该操作时使用了17K的输入和8K的输出
只调用一次API
所有时间戳均准确无误
[PixPin_2026-09-29_01-33-13]
唯一缺点是该专有品牌采用了中文名称,这个中文名在互联网上均无法查询到
[PixPin_2026-09-29_01-51-37]
[PixPin_2026-09-29_01-52-16]
[PixPin_2026-09-29_01-51-3...