我用一個 Claude Skill (技能) 省下了所有生成圖片和影片的訂閱費用!每個月現省上千元! — Transcript
Full transcript
- 0:02嗨,大家好
- 0:04平常如果我们想要用 AI 来生成图片或影片
- 0:07最常见的方式就是订阅各种线上的 AI 平台
- 0:11不过这些服务每个月可能都要固定支付 10 至 15 美元以上
- 0:15部分进阶的方案甚至更贵
- 0:18这对于只是偶尔使用
- 0:19或是单纯想要体验 AI 创作的用户来说
- 0:22是一个不小的负担
- 0:24因此今天我要向大家介绍一个更具弹性的方式
- 0:28就是在自己的 AI 助理
- 0:29像是 ChatGPT 或 Claude 安装一个 Skill (技能)
- 0:33让 AI 助理能以非常低廉的成本来生成图片和影片
- 0:37不需要绑定任何的订阅方案
- 0:40好,那这边我们首先要下载 Claude 或 ChatGPT 的桌面版软体
- 0:44因为后续我们需要让 AI 助理读取参考图片
- 0:48并且将生成好的档案储存到指定的位置
- 0:51而如果你习惯使用 ChatGPT
- 0:53你也可以在它的官网首页来下载它的桌面版软体
- 0:57好,那我以 Claude 为例
- 0:59下载并安装完成后
- 1:01你可以直接把桌面版的软体打开
- 1:04而这边我们需要在电脑中
- 1:05先建立一个专案资料夹
- 1:08你可以随意找一个位置
- 1:10利用滑鼠右键执行「新增」
- 1:12并取一个自己容易记住的名字
- 1:15建立好后
- 1:16我们对着资料夹双击滑鼠左键来将它打开
- 1:20并且重复刚才的步骤
- 1:21另外建立两个资料夹
- 1:23分别是「完成档」和「参考图」
- 1:25之后我们会使用到
- 1:28资料夹准备好之后
- 1:29你就可以回到桌面版的软体
- 1:31来将目前的专案指定到刚建立的资料夹
- 1:34点击「打开」
- 1:36再按下「信任此工作区」
- 1:39而如果你使用的是 ChatGPT
- 1:41方式也大同小异
- 1:43你只要把来源资料夹
- 1:45同样指定到刚才的位置就 OK 了
- 1:48好,那接下来我们要来到一个叫做 FAL 的平台
- 1:51它的优点是提供的 AI 模型非常地多
- 1:54且计费方式非常地透明
- 1:56你可以用自己的 Gmail 信箱先注册一个帐号
- 2:00登入之后
- 2:01我们要取得一个叫做 API Key 的金钥
- 2:04系统会使用这把金钥来辨识你是哪一位使用者
- 2:08好,所以我们到右上角点击「新增金钥」
- 2:11点击「建立」
- 2:13然后你就可以把荧幕上显示的金钥密码拷贝下来
- 2:16妥善保存在自己的电脑
- 2:19那 FAL 不需要你支付固定的月费
- 2:22而是按照你实际生成的图片数量来计算费用
- 2:25因此我们必须先绑定一张信用卡
- 2:28绑定完成后
- 2:29切换到 Credits 的页面
- 2:32那一开始其实不需要储值太多
- 2:34你可以等熟悉操作之后
- 2:36再视自己的需求来增加额度
- 2:39而要查看 FAL 有提供哪些 AI 模型
- 2:42你可以到左上角点击「探索」(Explore)
- 2:44如此你就能在页面左侧看到所有的模型分类
- 2:48例如 Text to Image 就是所谓的「由文字生成图片」
- 2:52那目前「文生图」的 AI 模型
- 2:54其中最受欢迎的一个
- 2:56是由 Google 推出的 Nano Banana 2
- 2:59那这个页面有提供了一个简单的范例
- 3:02左侧的 Prompt 栏位是这张图使用的提示词
- 3:06然后下面有一个宽高比的下拉选单
- 3:09再下来是影像的解析度
- 3:11而在旁边有一个进阶设定的按钮
- 3:14你可以在这个区块指定生成图片的数量
- 3:17以及图档要采用哪一种储存格式
- 3:20最后在右栏有一项很重要的资讯
- 3:23就是在使用 Nano Banana 2 的时候
- 3:25费用是如何计算的
- 3:27你可以把这些资讯做个拷贝
- 3:30来跟其它 AI 模型做个比较
- 3:32譬如目前另一个很热门的 AI 模型是 GPT Image 2
- 3:36你可以进入它的页面之后
- 3:38同样找到它的计价方式
- 3:40把它拷贝下来
- 3:42然后我们就可以在 ChatGPT 把两个模型的价目表贴上去
- 3:46请它来做个分析
- 3:47看看哪个比较划算
- 3:50好,那分析的结果
- 3:51ChatGPT 认为使用 Nano Banana 2 来生成图片会比较省钱
- 3:56所以我打算把它当成主力的模型
- 3:59接着再回到 FAL 的官网
- 4:01将 Nano Banana 2 的模型 ID 做个复制
- 4:04那这边有个要注意的地方
- 4:06就是 FAL 提醒我们
- 4:08一个模型可能会使用不同的接口 (Endpoints)
- 4:10来执行不同的任务
- 4:12以 Nano Banana 来说
- 4:13它有两个接口
- 4:15一个是「文字生成图片」
- 4:17而另一个是「修改现有的图片」
- 4:20至于 GPT Image 2 这边也是一样的
- 4:23总共有两个不同的接口
- 4:25好,取得了 API 金钥和模型的 ID 之后
- 4:28我们可以回到 Claude 准备来建立一个 Skill (技能)
- 4:31所谓「技能」
- 4:32你可以把它当成是一个让 AI 助理阅读的操作手册
- 4:36让它知道在执行任务时要遵守哪些要点
- 4:40举例来说
- 4:40我们可以告诉 Claude
- 4:42只要我们请它生成或编辑图片
- 4:44就要启用这个技能
- 4:46使用的模型包含了 Nano Banana 2 和 GPT Image 2
- 4:51同时要提醒它必须依照任务的类型
- 4:53来选择正确的接口
- 4:55那这边还有一点要特别注意
- 4:57就是我们刚才取得的 API 金钥不要直接贴给 Claude
- 5:01因为这有可能会让金钥
- 5:02随着对话内容一同曝光到网路上
- 5:05比较合适的做法
- 5:07是把这类型的机密资讯
- 5:08储存在一个叫做 .env 的档案
- 5:11让程式在执行时自动读取
- 5:14那最后我们也要在提示词中说明
- 5:16如果生成的任务需要用到参考图
- 5:19AI 助理可以到「参考图」资料夹内来存取这些档案
- 5:23至于生成好的图片则统一放到「完成档」资料夹
- 5:27并且以模型名称加上日期时间来作为档名
- 5:31好,那我把这个提示词贴到输入框内
- 5:33并且按下 Enter 键送出
- 5:36Claude 有可能会在建立技能的过程中
- 5:38向我们询问一些问题
- 5:40你可以依照自己的需求来进行作答
- 5:43也可以直接采用它提供的建议
- 5:46等技能建立完成后
- 5:47你就可以打开 Claude 替我们准备好的 .env 档案
- 5:51让它显示在电脑的资料夹内
- 5:54接着再将这个档案使用一般的记事本开启
- 5:57来把先前我们取得的 API 金钥贴到指定的位置
- 6:01最后再按下 Ctrl +S 执行储存
- 6:04好,那我们就来测试一下建立好的技能吧
- 6:07我请 Claude 生成一张图片
- 6:09主题是一个在古罗马竞技场奋战的角斗士
- 6:13然后将提示词送出
- 6:15过程中如果跳出授权的对话框
- 6:17就直接按下「允许」
- 6:19于是过了一会儿之后
- 6:21一张手持剑盾的角斗士图片就生成完毕了
- 6:25而且图片也已自动储存到先前我们指定的资料夹
- 6:29OK,那接着我们来试试看
- 6:31让 AI 修改现有的图片
- 6:34举例来说
- 6:34这里我有一张狮子的图片
- 6:37我想要让牠穿上一套金色的铠甲
- 6:39而要让 Claude 能取得这张图片
- 6:42我们必须先把图档拷贝起来
- 6:44进入到专案中的「参考图」资料夹
- 6:47然后按下 Ctrl +V 来将图档贴上
- 6:50参考图放到定位之后
- 6:52你可以回到 Claude 来撰写生成图片的提示词
- 6:56如有需要
- 6:57你甚至可以请 Claude 使用不同的模型各生成一张图片
- 7:00方便我们对照两个模型输出图片的风格特色
- 7:04好,我们将提示词送出
- 7:06稍待片刻后
- 7:07Claude 便回传了两张生成好的狮子图片
- 7:10甚至还贴心说明了两个作品在细节上的差异喔
- 7:14好,当我们在撰写图片提示词时
- 7:17常会遇到一个瓶颈
- 7:19就是我们不知道该如何描述画面中的细节
- 7:22像是场景该如何铺陈
- 7:24镜头视角该如何拿捏等
- 7:27而这种需要专业知识的任务
- 7:29其实我们也可以交给 AI 助理来代劳
- 7:32就是把原来的技能做个改写
- 7:34请它在生成图片时
- 7:36先依据我们提供的主题自动补充更丰富的细节
- 7:40而且修改好后要先让我们过目
- 7:42确认没有问题之后才能送出
- 7:45OK,技能修改完成后
- 7:47我们来验收一下成果
- 7:49譬如我请 Claude 生成一张
- 7:51「苏格拉底在雅典街头与别人辩论」的图片
- 7:55然后将提示词送出
- 7:57而这一次 Claude 并没有直接动工
- 7:59而是先把这个主题
- 8:01扩展成一段内容详尽的提示词
- 8:03包含了人物的神态
- 8:05周围的建筑
- 8:06乃至于镜头的焦段等全都描述得一清二楚
- 8:10而我们看过觉得没有什么问题的话
- 8:12就可以请 Claude 送出
- 8:14于是很快地
- 8:15一张生动地苏格拉底辩论的场景就呈现在我们的眼前啰
- 8:20OK,那这个技能不光可用来生成图片
- 8:23如果想要生成影片也没有任何问题
- 8:26我们一样可以回到 FAL 的网站
- 8:28在左侧的分类中勾选 Text to Video (文字生成影片)
- 8:32以目前来说
- 8:33生成影片效果最出色的模型首推 Seedance 2.0
- 8:37而旁边的 Minimax H3 则是前几天才刚亮相的新模型
- 8:42除此之外
- 8:43下面还有一个性价比很不错的选择是 Kling V3
- 8:47那同样地
- 8:48你可以逐一进入这几个模型的页面
- 8:51把它们的计价资讯拷贝下来
- 8:53一同交给 AI 来进行分析和比较
- 8:56等你选定好中意的主力模型之后
- 8:59你就可以写一段提示词
- 9:01请 Claude 把影片生成的功能
- 9:03一并加入到原有的技能之中
- 9:05而由于影片的设定参数较多
- 9:08而且每个模型的数值都不太一样
- 9:10因此这边我让 Claude 采用一问一答的方式
- 9:13协助我们来进行设定
- 9:16好,我将提示词送出
- 9:18功能一切就绪之后
- 9:19就可以立即来做个测试
- 9:21例如我指定用 Kling 3.0 生成一段影片
- 9:24让一位穿着时尚的男子朝着镜头走过来
- 9:27然后拿出一条巧克力棒咬了一口
- 9:30接着按下 Enter 键送出
- 9:32同样地
- 9:33Claude 会根据这个主题先进行提示词的优化
- 9:37我们看过没有问题之后
- 9:38Claude 就会开始逐一询问影片参数的细节
- 9:42包含影片的秒数
- 9:43宽高比要设为多少、以及是否要生成音讯
- 9:47全部确认完毕后
- 9:49Claude 就会开始进行影片的生成
- 9:52好,我们来看一下生成好的作品
- 10:04OK,那在生成影片时有一个很常见的技巧
- 10:08就是我们先提供一张静态的图片作为初始影格
- 10:12然后请 AI 将这张图片动起来
- 10:15那我们来看一个例子
- 10:17譬如这里有一张图片
- 10:18是一名女子将脸颊贴在一条巨大的飞龙头上
- 10:22而我想让 AI 延伸出后续的画面
- 10:25同样地
- 10:26我们要先把这张图片做个拷贝
- 10:29进入到「参考图」资料夹
- 10:31按下 Ctrl +V 来将它贴上
- 10:33然后我们再回到 Claude 的介面来撰写提示词
- 10:37譬如这一次我改用 Minimax H3 的模型
- 10:40让女子抬起头跟飞龙一同看向相机的镜头
- 10:44并且将镜头逐渐拉远
- 10:46然后按下 Enter 键送出
- 10:48那 Claude 同样会先替我们优化提示词的内容
- 10:51来扩展影片中的细节
- 10:53接着再向我们逐一确认影片的各项参数
- 10:57包含长度要设为几秒
- 10:58解析度要设为多高
- 11:01确认完毕后
- 11:02Claude 就开始执行影片生成的任务
- 11:04于是片刻之后
- 11:06一段充满史诗感的奇幻短片就成功产生啰
- 11:13OK,最后如果你想让生成图片和影片的流程更加顺手
- 11:17我们甚至还可以更进一步
- 11:19请 Claude 把这个技能改造成一个桌面版的 App
- 11:23由于这是一个比较大的任务
- 11:25所以你可以把 Claude 先切换成「计划」(Plan) 模式
- 11:28接着再来描述我们心目中理想的 App 样貌
- 11:32像是视窗版面的布局
- 11:34想要走什么样的设计风格
- 11:37面板内应该有哪些栏位和按钮
- 11:40以及生成好的作品要如何呈现和管理等
- 11:43把这些想法送出之后
- 11:45Claude 会询问我们一些问题
- 11:46来确认实作的细节
- 11:48如果你对于技术层面的术语不太熟悉
- 11:51可以直接采用它给的建议就 OK 了
- 11:54细节都确认完毕之后
- 11:56Claude 会先写一份计划的提案
- 11:58看过之后如果没有问题
- 12:00Claude 就会开始着手实作
- 12:03好,那 App 目前已制作完成
- 12:05我们可以把它打开实际来测试一下
- 12:09首先 API 金钥的部分
- 12:11你只要打开「设定」对话框
- 12:13就能把金钥贴到栏位里面来做妥善的保存
- 12:16而在介面的左上角
- 12:18我们可以自由切换「图片」和「影片」两个分页
- 12:21至于要使用哪一个 AI 模型
- 12:24则可透过底下的下拉选单来做挑选
- 12:27由于这个 App 目前还缺少一个专属的图示
- 12:30所以我们不妨借着这个机会
- 12:32让 App 自己来生成
- 12:34例如我想要生成一个抽象几何风格
- 12:37带有圆角造型的白色图示
- 12:40宽高比的话可以设成 1:1
- 12:42然后按下「生成」按钮
- 12:44图示生成完毕后
- 12:46我们就把它储存到电脑资料夹
- 12:48并且将它命名为 Icon
- 12:50那最后我们就让 Claude
- 12:52把这个 App 的外观套用刚制作好的图示
- 12:55并且将 App 安装到「应用程式」资料夹
- 12:59如此一来
- 12:59之后当我们想要生成图片或影片的时候
- 13:02只要在电脑内打开这个 App 就能立即使用
- 13:05是不是非常地方便呢?
- 13:08OK,那今天关于 Claude 生成图片和影片技能的介绍
- 13:12我们就聊到这边
- 13:13我们下回再见
- 13:15拜拜
About this transcript
This page contains the full transcript of 我用一個 Claude Skill (技能) 省下了所有生成圖片和影片的訂閱費用!每個月現省上千元! by PAPAYA 電腦教室, generated from the public captions YouTube serves with the video. The transcript has 537 words across 303 segments, with the original timestamps preserved so you can click any line to jump to that moment in the embedded player.
What you can do with it
Use the transcript to take notes, quote the speaker, build a study guide, generate a summary with ChatGPT or Claude via the YouTube Summary tool, or export it as a timed subtitle file with YouTube to SRT. You can also re-open it in the transcriber to translate the transcript into 100+ languages.
Free YouTube transcript tool
YouTube2Text is a free YouTube transcript generator — no signup, no daily limit. Paste any YouTube link and get the full transcript instantly, with timestamps, click-to-jump, translation to 100+ languages, AI prompts for ChatGPT, Claude, and Gemini, and exports to TXT, SRT, VTT, or Markdown.