做一个基于 FFmpeg 的 AI Agent 智能体

FFmpeg AI Agent:一条自然语言指令,实现一个简单音视频处理。

让用户说一句:音视频的处理要求,AI Agent 帮你把活给做了。

实现比较简单,抛砖引玉,留下 tools 接口,可以无限扩展。

项目开源地址:runner365/gollmagent

1. 主要功能

支持连接多个大模型平台:

  • OpenAI

  • Yuanbao(腾讯)

  • Qwen(阿里)

当前支持下面一些音视频处理功能:

  • 将多媒体文件提取音频,转换为 m4a 格式

  • 将多媒体文件转换为 mp4 格式,主要为视频文件,并显示进度

  • 合并多个多媒体文件为一个带有视频和音频的 mp4 文件

  • 合并多个多媒体文件的音频为一个纯音频的 m4a 文件

  • 给视频添加图片水印

  • 给视频添加文字水印

  • 给视频添加字幕

  • 基于视频的 I 帧生成图片

  • 在指定时刻截取视频帧

向大家推荐这本书《深入理解 FFmpeg》,很多命令行都从这里借鉴而来。

并且这本书后半部分讲解 FFmpeg API 的二次开发非常详细,作者显然有丰富的 FFmpeg API 开发经验。

图片

2. 如何使用

2.1. 基础环境

  • golang 开发环境

  • 安装 ffmpeg:可在系统下运行 ffmpeg 命令行

  • 设置环境变量 LLM_API_KEY:大模型的 API_KEY,从各个大模型云厂商获取和配置你自己的 API_KEY,个人测试过腾讯元宝大模型、阿里 Qwen 大模型、OpenAI 大模型

个人推荐腾讯元宝大模型,它的 tools 比较灵活,输入语句缺少参数信息,会有多轮对话自动提醒功能,国内的大模型网络也比较快。

环境 ready 后,直接运行:go run gollmagent.go

图片

系统启动一个对话命令行,可以与 AI 大模型继续聊天,来完成音视频处理任务。

下面给出一些通过与 AI 大模型聊天,来处理音视频文件的例子。

2.2. 转码视频

直接向 AI 提问,要求转码一个视频文件,并指明分辨率。

用户: 请转码一个视频文件为360p,文件地址:D:\movies\src\wenjian.mp4
AI: 转码任务已启动,输出文件为 D:\movies\src\wenjian_360p.mp4,需要几分钟,请稍后。
AI: 当前进度: 7.27%,转码中,已耗时1125毫秒。
AI: 进度34.33%,转码中,已耗时5145毫秒。
AI: 进度58.13%,转码中,已耗时8650毫秒。
AI: 进度:84.95%,状态:转码中,耗时:12658毫秒
AI: 任务进度: 100.00%,转码已完成。
用户: 谢谢
AI: 不客气,有什么我可以帮你的吗?

转码完成后,可以得到一个自己想要分辨率的媒体文件。

2.3. 合并多个视频

向 AI 提出要求,合并多个视频文件,给出文件列表。

用户: 合并多个视频文件,文件列表为: D:\movies\src\1.mp4, D:\movies\src\2.mp4, D:\movies\src\3.mp4
AI: 已合并视频文件,输出为 1_concat_2193.mp4。

合并完成后,AI 告知合成后的媒体文件地址。

2.4. 截取视频某个时刻的图片

向 AI 提出要求,截取某个视频某时刻一张图片。

用户: 对视频文件D:\movies\src\2.mp4,在00:00:15截取一张图片
AI: 已截取视频帧,图片保存为2_screenshot_00_00_15.png

完成后,AI 告知图片的地址。

2.5. 获取视频所有 I 帧的图片

向 AI 提出要求,截取某个视频中所有 I 帧,并生成图片列表。

用户: 对视频D:\movies\src\1.mp4的所有iframe截取图片
AI: 已从视频D:\movies\src\1.mp4提取I帧图片,保存在D:\movies\src\1_pics目录下。

完成后,AI 会告诉图片的目录。目录下生成所有的 I 帧图片:

图片

2.6. 对视频文件加入图片水印

向 AI 提出要求,对某视频文件加入图片水印。

用户: 对视频文件D:\movies\src\1.mp4添加水印:D:\movies\src\media_talk_Logo.png, 位置左上角
AI: 已为视频添加左上角水印,输出文件为1_watermarked.mp4。

AI 生成新视频后,会告知新视频文件地址。

图片

其他的一些功能(不再详细叙述):

  • 将多媒体文件提取音频,转换为 m4a 格式

  • 合并多个多媒体文件的音频为一个纯音频的 m4a 文件

  • 给视频添加字幕

3. 扩展:动态添加新功能

AI Agent 的 tools 功能,就是向大模型注册一个 Tools 列表,包含一些功能,功能映射的函数,函数需要的参数。

这里程序给出简单的注册新 tools function 接口,在 llmproxy/tools.go 中注册新写的函数接口。

以注册一个图片截图功能为例。

3.1. 第一步:向 AI 大模型注册功能

func AddScreenshotAtMomentTool() *pub.ToolDefinition {
    screenshotAtMomentParams := map[string]interface{}{
        "type": "object",
        "properties": map[string]interface{}{
            "input_file": map[string]interface{}{
                "type":        "string",
                "description": "输入的视频文件路径",
            },
            "moment": map[string]interface{}{
                "type":        "string",
                "description": "截图时刻,格式为 HH:MM:SS",
            },
        },
        "required": []string{"input_file", "moment"},
    }
    tool := AddFunctionTool("screenshot_at_moment", "在指定时刻截取视频帧", screenshotAtMomentParams)
    return tool
}

func InitTools() string {
    //....
    FunctionTools = append(FunctionTools, AddScreenshotAtMomentTool())
    //...
}

3.2. 第二步:实现 screenshot_at_moment 功能函数

func CreateFunctionToolsHandler() {
    //.....
    functions["screenshot_at_moment"] = ScreenshotOnePictureAtMoment
}

func ScreenshotOnePictureAtMoment(args map[string]interface{}) interface{} {
    inputFile, ok := args["input_file"].(string)
    if !ok {
        log.Errorf("invalid input_file arguments %+v", args)
        return "invalid input_file arguments"
    }
    moment, ok := args["moment"].(string)
    output := fmt.Sprintf("%s_screenshot_%02d_%02d_%02d.png", strings.TrimSuffix(filepath.Base(inputFile), filepath.Ext(inputFile)), hours, minutes, seconds)

    //do ffmpeg cmd job
    ffmpegcmd.ScreenshotOnePictureAtMoment(inputFile, moment, output)

    //返回图片文件
    return output_file
}

只需要两步,就能注册一个新的 AI Agent 功能。

这个开源功能很简单,仅仅是抛砖引玉,如果有很多的想法,可以在评论区讨论。