分类: 33

  • AI视频分析教程:让Gemini按时间戳提取视频重点

    一句话结论:做 AI 视频分析时,要在提示词里写清时间范围、关注对象和输出格式;需要定位片段时,要求按时间戳给出事件和依据。

    这篇教程依据 Google Gemini 视频理解文档整理,适合课程回顾、产品演示复盘和公开视频内容提要。视频分析结果仍需要抽样回看,尤其是快速动作、画面文字和多人对话。

    时间戳提取模板

    请分析这段视频,输出 Markdown 表格:时间段 | 发生的事件 | 关键人物或物体 | 证据说明。
    要求:
    1. 使用 mm:ss-mm:ss 格式;
    2. 只记录能够从视频确认的事件;
    3. 对不确定内容写“无法确认”;
    4. 最后给出 5 条重点和 3 个需要人工复核的片段。
    重点关注:产品演示中的操作顺序、错误提示和最终结果。

    分层分析方法

    1. 先做全片概览,确认视频主题和章节。
    2. 再按时间段提取事件,避免只依赖一段长摘要。
    3. 对关键片段提出第二轮问题,例如“00:35 到 00:52 出现了哪些界面变化”。
    4. 把视频结论与字幕、脚本或产品日志交叉核对。

    静态采样的限制

    视频理解可能按照采样帧分析画面,快速动作可能在采样间隔中被遗漏;声音、字幕、分辨率和画面复杂度也会影响结果。对安全事故、体育细节或快速操作,必须回看原视频,不要仅凭摘要下结论。

    如何写更准确的任务

    不要只说“总结视频”,而要说明读者、时间粒度和输出目的。例如课程复盘要关注知识点和练习,广告审核要关注品牌露出和违规风险,产品演示要关注点击顺序和报错信息。不同目标应使用不同提示词。

    常见问题

    AI 能准确指出每个动作的时间吗?

    不能保证。时间戳通常是近似定位,需要人工回看关键片段。

    视频越长越好吗?

    不一定。长视频应先分章节或缩小问题范围,便于复核和控制成本。

    能同时分析声音和画面吗?

    具体能力取决于模型、文件和当前接口支持,应先用小样本验证。

    如何分析一节课程?

    让模型输出章节、关键概念、示例、练习和时间戳,再由讲师检查术语。

    可以把视频摘要当成事实记录吗?

    不可以。摘要是模型生成结果,关键事实要回到视频或原始记录。

    信息来源与说明

    本文参考 Google Gemini 官方视频理解文档整理。支持的模型、文件方式和长度限制可能变化,请以官方文档为准。

  • AI语音转文字教程:把录音整理成可编辑的会议初稿

    一句话结论:AI 语音转文字最适合先生成可编辑的会议初稿,再用原音频、参会名单和上下文核对专有名词、数字、日期与发言人。

    本文基于 OpenAI Speech-to-text 官方文档,演示如何把录音整理成会议材料。转写不是录音证据的替代品,涉及合同、承诺和责任归属时必须回听原音频。

    推荐的处理流程

    1. 确认参会者已知悉录音和处理用途。
    2. 分割过长音频,并保留原始文件和时间信息。
    3. 先获取逐字转写,再让 AI 生成摘要和待办。
    4. 让模型标注听不清的片段,不要自动补全。
    5. 由会议主持人核对最终版本后再分发。

    会议整理提示词

    请把下面的会议转写整理为:
    1. 100 字以内摘要;
    2. 已作出的决定;
    3. 待办表格:任务、负责人、截止日期、依据原句;
    4. 待确认问题;
    5. 需要回听的时间段。
    规则:不得把建议写成决定;转写中没有负责人或日期时填“待确认”。

    为什么要分两步

    先转写再整理,能把原始文本和总结分开保存。若直接让模型“听完告诉我结论”,很难追溯某条待办来自哪里。对中文姓名、品牌、技术名词和数字,要提供词汇表或在转写后人工搜索核对。

    实时转写和异步转写

    需要字幕或实时提示时,可使用支持流式返回的方案;需要完整会议纪要时,异步处理更容易保存和复核。网络中断、音频质量和说话人重叠都会造成缺字,应用应设计重试和人工补录。

    常见问题

    转写能做到百分之百准确吗?

    不能。口音、噪声、多人抢话和专有名词都会影响结果。

    可以直接把会议纪要发给客户吗?

    不建议未经审核直接发送。先确认事实、措辞、敏感信息和责任归属。

    怎样处理听不清的内容?

    标记时间段并输出“无法确认”,回听原音频或请参会者补充。

    录音中有隐私信息怎么办?

    遵循最小化原则,确认授权、访问控制、存储位置和删除周期。

    多语言会议怎么做?

    先测试语言识别和专有名词表现,必要时按语言分段,并人工检查翻译。

    信息来源与说明

    本文参考 OpenAI Speech-to-text 官方文档整理。模型、文件限制、流式能力和价格可能调整,请以官方当前说明为准。

  • AI图片识别教程:用视觉模型读取图片并输出结构化结果

    一句话结论:让 AI 识别图片时,应同时说明观察目标、输出字段、未知值处理方式和证据要求;如果要交给程序使用,优先要求结构化 JSON 并在程序端校验。

    这篇教程依据 OpenAI 图像与视觉文档整理,适用于票据初步整理、截图分析、产品照片分类和图表读取。视觉模型可能看错小字、遮挡内容和复杂图表,结果不能替代人工审核。

    识图任务的四项说明

    • 目标:是描述、分类、读取文字,还是找出异常。
    • 范围:只看整图,还是指定某个区域。
    • 输出:自然语言、表格或 JSON。
    • 不确定性:看不清时输出 null 或“无法确认”,不要猜。

    可复制的识图提示词

    请分析这张商品图片,只依据可见内容回答。
    输出 JSON,字段为:
    {
      "product_name": "商品名称,无法确认时为 null",
      "visible_text": ["图片中能准确读出的文字"],
      "main_colors": ["主要颜色"],
      "scene": "场景描述",
      "uncertainties": ["看不清或无法确认的内容"]
    }
    不要臆测品牌、价格、型号或图片外的信息。

    如何提高识别质量

    1. 上传清晰、方向正确的原图,避免反复压缩。
    2. 告诉模型需要读哪一块区域,复杂图片可以裁剪后分别分析。
    3. 先让模型描述可见事实,再做分类或判断,减少一步到位的猜测。
    4. 在代码中校验 JSON 字段和类型,解析失败时记录原始响应并进入人工队列。

    图像识别的边界

    图片里的微小文字、模糊号码、遮挡部分、复杂表格和医学影像都可能被误读。不要让模型单独决定付款、身份、医疗处置或安全告警。涉及个人照片和证件时,先确认授权、保存周期和访问权限。

    常见问题

    为什么要要求 JSON?

    固定字段便于程序消费和批量处理,但仍要在服务端用 JSON Schema 或代码再次校验。

    模型能读取任何图片文字吗?

    不能。分辨率、字体、反光、旋转和遮挡都会影响识别。

    一张图识别不准怎么办?

    裁剪目标区域、提高分辨率、补充任务说明,并让模型列出不确定字段。

    能让 AI 判断图片真假吗?

    不能仅凭一次视觉回答下结论。真伪鉴定通常需要来源、元数据和专业检测。

    是否需要记录模型版本?

    需要。生产系统应记录模型、输入、提示词、时间和人工修正,便于复盘。

    信息来源与说明

    本文参考 OpenAI Images and Vision 官方文档整理。实际支持的图片格式、尺寸和费用以当前 API 文档为准。

  • AI绘图教程:按照Adobe Firefly指南写出更准确的图像提示词

    一句话结论:AI 绘图提示词应优先写清主体、场景、构图和视觉风格;越具体的画面描述,越容易得到可比较、可迭代的结果。

    本教程按照 Adobe Firefly 官方关于有效文本提示的思路整理。不同生图模型对词语的理解不同,下面的结构适合用来建立第一版提示词,不代表每次都能得到完全相同的画面。

    四个维度写画面

    维度 要写什么 示例
    主体 人物、物品或动物 一盏放在木桌上的台灯
    环境 地点、时间、天气 安静的北欧书房,清晨
    视觉 材质、颜色、光线、镜头 暖色自然光,浅景深,产品摄影
    构图 视角、比例和主体位置 正面三分之二构图,留出右侧文案空间

    可直接改写的提示词

    一盏极简白色台灯,放在浅色橡木书桌上,北欧风格书房,清晨的柔和自然光,桌面有一本打开的笔记本和一杯咖啡,产品摄影,细节清晰,背景干净,主体位于左侧,右侧留白,横向画幅。

    从宽泛到具体

    “画一个好看的台灯”只说明了主体和主观评价;改成“白色极简台灯、橡木桌面、清晨自然光、产品摄影、右侧留白”,模型才有足够的画面线索。第一次不要同时塞入十几种互相冲突的风格,先固定主体和构图,再逐项调整颜色、材质和镜头。

    迭代方法

    1. 第一版只确定主体、环境和构图。
    2. 第二版只修改光线或色彩。
    3. 第三版再加入材质、镜头和商业用途。
    4. 保留每一版提示词和结果,比较哪一个词真正改变了画面。

    涉及人物肖像、商标、版权角色或真实客户素材时,要确认使用授权;AI 生成的文字、手指、标志和细小细节仍可能出错,需要人工检查。

    常见问题

    提示词必须写“生成一张”吗?

    不必须。直接描述画面往往更简洁,具体产品可按平台界面测试。

    风格词越多越好吗?

    不是。相互冲突的风格会让结果不稳定,建议一次只调整一组风格变量。

    如何生成适合文章的配图?

    说明横竖比例、主体位置和留白区域,同时要求画面不要出现难以控制的文字。

    为什么生成的字经常不对?

    许多生图模型对小字和长句支持有限。可以留白后用设计软件添加文字。

    能保证每次结果一致吗?

    不能。模型、版本、随机种子和参数都会影响结果;重要素材要保存源文件和参数。

    信息来源与说明

    本文参考 Adobe Firefly 官方有效提示词教程整理。商业使用前请查看具体服务条款和素材授权范围。