Mozi (@yeahhe) 在 基于Gemini的多模态做了两个有意思的功能 中发帖
[PixPin_2026-08-29_12-32-05]
[PixPin_2026-08-29_12-38-13]
视频导航功能,直接将视频拖入聊天框中,就能AI大模型读视频给出定位
[PixPin_2026-08-29_12-34-11]
[PixPin_2026-08-29_12-36-44]
PDF定位功能,问一句话就可以分析PDF的内容,并找出对应的页码标注位置
这个功能其实很久以前就做了,但是我现在把它合并到我的聊天工具中