结论先行:C 端头部 App 全部绑定自家自研模型(豆包=字节Seed、千问=Qwen、元宝=混元+DeepSeek双模),独立厂商(Kimi、智谱)C 端存在感走弱、转向模型与 B 端。这对你的启示:没有一家在"记忆/关系"层建立心智,全部在卷模型能力和通用助手场景——你不需要跟他们比模型,比"记得住"。
| App | 厂商 | 底层模型(2026-07口径) | 定位/心智 | 与你的关系 |
|---|---|---|---|---|
| 豆包 | 字节跳动 | Doubao-Seed-1.6 / 2.0-Pro(推理版 Seed-Thinking;视频 Seedance;生图 Seedream) | 月活3.45亿的国民级全能助手,生活娱乐第一 | 主要"记忆难民"来源:免费版记忆弱、7·15智能体下架 |
| DeepSeek | 深度求索 | DeepSeek-V3.1 → V4-Pro(R1 推理系) | 数理/代码最强心智,技术流 | 无个人记忆产品,纯模型心智 |
| 千问App(原通义) | 阿里 | Qwen3 系列(Qwen3.6-Max-Preview) | 电商+多模态,阿里生态入口 | 7·15同批下架智能体 |
| 腾讯元宝 | 腾讯 | 混元 Hunyuan + DeepSeek 双模型切换 | 微信生态内独占(公众号语料检索) | 7·15同批下架智能体 |
| Kimi | 月之暗面 | Kimi K2 → K2.6 | 长文档办公最强(200万字上下文) | C端掉队转B端;长上下文≠长记忆,会话间仍失忆 |
| 文小言 | 百度 | 文心 ERNIE 4.5 / X1 | 搜索+知识问答 | - |
| 智谱清言 | 智谱AI | GLM-4.5 / GLM-4.5V | 学术/开发者向,C端收缩 | - |
| 讯飞星火 | 科大讯飞 | 星火 Spark X1 | 教育/办公/政企 | - |
| 猫箱 / 星野 | 字节 / MiniMax | 豆包大模型 / MiniMax abab系 | AI角色陪伴(受7·15新规重压) | 陪伴盘不能接,但其用户对"记忆资产"最敏感 |
依据:新浪《2026 国产大模型排行》、每经《2026Q1 AI应用价值榜》(豆包月活3.45亿/元宝跌出前三/Kimi智谱掉队)、36氪五款国产AI实测、知乎《国内外知名大模型及应用 2026/07/17》。7月第三周 Panda 榜单最强国产模型:DeepSeek-V4-Pro、Doubao-Seed-2.0-Pro、Kimi-K2.6、Qwen3.6-Max-Preview。
采集方法:抖音搜索 8 组关键词(AI软件推荐/AI工具变现/AI课程/AI训练营/卖课知识付费/软件介绍售卖/AI副业项目/效率软件安利),按最多点赞排序,240张卡片解析去重后按"成交型信号"打分筛出49条,人工复核出19条。本次更新:19条全部下载原片并用 Whisper large-v3 逐条转写,每条给出「重点提炼」(钩子原话/结构骨架/成交动作/金句/可抄点),并附可点击展开的全文转写;互动数据同时换成分享接口的精确口径(2026-07-28 抓取),不再是搜索卡片的约数。
| # | 账号 | 内容类型 | 点赞 | 收藏/点赞 | 转发/点赞 |
|---|---|---|---|---|---|
| ⑬ | @周好好探索AI | 清单/资料型 | 13.9万 | 1.45 | 0.60 |
| ⑭ | @微微辣不加班 | 清单/资料型 | 1.9万 | 1.20 | 0.22 |
| ⑩ | @云卷卷 | 清单/资料型 | 2.3万 | 1.14 | 0.16 |
| ⑰ | @郑经说 | 观点型 | 8057 | 0.96 | 0.29 |
| ④ | @杜恩泽·AI分享与思考 | 拆解型 | 38.4万 | 0.91 | 0.41 |
| ⑮ | @Nenly同学 | 引流长课 | 2.6万 | 0.87 | 0.12 |
| ⑨ | @游戏阿龙 | 单品安利型 | 6.2万 | 0.86 | 0.19 |
| ⑪ | @小何的ai工具 | 梗图型 | 3.4万 | 0.85 | 0.26 |
| ⑥ | @小梨蛋包 | 案例故事型 | 3.9万 | 0.83 | 0.22 |
| ⑤ | @天线短路宝宝 | 拆解型 | 3.4万 | 0.80 | 0.38 |
| ⑦ | @熊迪来了 | 方法论型 | 2.7万 | 0.73 | 0.22 |
| ⑧ | @珍妮丁丁说AI | 评测型 | 6.2万 | 0.70 | 0.16 |
| ⑲ | @小何的ai工具 | 梗图型 | 7712 | 0.66 | 0.17 |
| ⑱ | @张沫凡MOMO | 单品安利型 | 1.0万 | 0.65 | 0.20 |
| ② | @影视飓风知识服务旗舰店 | 卖课/成交型 | 1.4万 | 0.43 | 0.16 |
| ① | @影视飓风 | 卖课/成交型 | 16.1万 | 0.31 | 0.23 |
| ⑯ | @小宁的AIclass | 卖课/成交型 | 7781 | 0.19 | 0.21 |
| ⑫ | @大丽 | 促下载型 | 3.5万 | 0.18 | 0.02 |
| ③ | @影视飓风 | 卖课/成交型 | 2.7万 | 0.18 | 0.09 |
绿色=收藏率高于点赞(资料型,用户当工具存);红色=收藏率低于 0.35(成交型,用户看完就走或去下单)。数据为 2026-07-28 精确口径。
| 钩子原话 | 「这是现在 AI 能做到的能力……甚至你可以做出像这样的、这样的、还有这样的效果」——前 8 秒不自我介绍、不说产品,先用成片画面连甩三次做能力轰炸。 |
|---|---|
| 结构骨架 | 0-8s 能力轰炸:只放成片,「这样的×3」排比堆冲击 8-20s 反问式承诺:「你只需要稍微学习就能做出和我们一样的画面,我们还全包你学习过程中所有生成的积分和算力……你会想尝试一下吗?」——先给结果再给条件 20-40s 资历背书:「我是 Tim,2014 年创立影视飓风,运营四个内容账号、上千条爆款、全网 7000 万粉」 40-55s 沉没成本叙事:「AI 是挑战也是机遇,公司短片组深耕 AI 两年,已获国际 AI 奖项」→ 所以把内部经验沉淀成课 55-75s 交付清单:模型基础认知 → 生成逻辑 → 提示词 → 图片/视频生成 → 主流玩法,逐一拆解 75-95s 主动点破顾虑:「我们也十分清楚,AI 生成它不是无限免费的」→ 赠价值 200 元 AI 跟练室 95-106s 报价+收尾:49 元,「期待你的作品,我们课上见」 |
| 成交动作 | 全片唯一一次提钱在最后 10 秒,只报一个数字「首发定价 49 元」,没有"买/下单/点击购物车"任何一个字,收尾是「我们课上见」而不是「快来买」。 |
| 金句 | 「我们把内部所有的 AI 实践经验沉淀下来」·「AI 生成它不是无限免费的」(主动自曝成本=可信) |
| 可抄给 Mars | ① 开场照抄「成品轰炸」——Mars 的成品就是关系星图,连甩三张不同直播生成的星图;② 中段把资历换成你们的真实里程碑(复盘过 X 场直播、处理过 X 万条弹幕);③ 主动点破用户最大顾虑再给解法(Mars 的顾虑是「我的聊天记录安全吗」,别躲,正面讲);④ 价格只出现一次、放最后一句、不促销不倒计时。 |
00:00这是现在AI能做到的能力在如今成熟的模型之下它的能力难以想象甚至你可以做出像这样的这样的还有这样的效果但如果现在我说你只需要稍微学习可以做出和我们一样的画面并且我们还将全包你学习过程中
00:16所有生成所需的积分还有算力让你零基础也能做出漂亮的AI视频这样的话你会想要尝试一下吗好各位 我是Tim2014年我创立影视飓风
00:32之间我们运营了四个内容账号产出过上千条爆款作品全网累计7000万粉丝对于深耕影像创作的我们来说AI的发展无疑是巨大的挑战但同样也是全新的机遇像我们公司的短片组深耕AI两年之久目前已经获得了国际上的AI奖项
00:48所以我们把内部所有的AI实践经验沉淀下来精心打播成了这套课程影视飓风AI 生存AI实战课让你零基础也能做AI视频课程会从AI模型基础认知讲起带你吃透AI影像的生成逻辑再一步一步落地实操从提示词撰写
01:04到图片 视频的生成还有目前AI最主流的应用和玩法这些我们都将逐一拆解并且教授给你那当然我们也十分清楚AI生成它不是无限免费的每生成一张图 一段视频它背后都需要模型计算也会消耗各种积分和费用
01:20所以为了能让你真正跟着课程练起来在这一门课中我们会赠送给你价值200元的课程AI跟练室全部使用市面上的优质模型让你在学习过程中可以放心跟练无需担心积分成本那最后我们知道课程的首发定价是多少呢
01:35仍然是49元因为我们想让屏幕前的你能够真正用上AI并且和我们一起无压力解锁AI创作所以期待你的作品我们课上见
| 钩子原话 | 「如果你一直想学 AI 视频却不知道从哪里开始,那这门影视飓风 AI 实战课就是为你准备的,49 元」——6 秒内做完人群点名+产品名+报价三件事。 |
|---|---|
| 结构骨架 | 0-6s 人群点名+产品+价格全部前置(与主号①完全相反的打法) 6-20s 交付物清单:16 节课 / 建立创作思路 / 把想法变成画面 / 让 AI 更懂你的需求 / 做出专属 AI 视频 20-30s 赠品一:价值 200 元专属 AI 跟练室——「不用担心练习成本」 30-36s 赠品二:优惠礼包,更低成本用优质模型 36-42s 赠品三:可参加同款平台的 AI 创作比赛 → 「我们课上见」 |
| 成交动作 | 价格前置 + 三层赠品叠加的标准促单话术,42 秒无钩无故事,全靠挂车承接。这是店号的活,主号绝不能这么说话。 |
| 金句 | 「49 元……16 节课程」——用交付量对冲价格,不打折也显得便宜。 |
| 可抄给 Mars | 这 42 秒就是 Mars 企业号促单模板:「想让 AI 记住你所有客户,却不知道从哪开始,Mars 就是给你准备的,$20 一个月」+ 三层赠品(首月免费复盘一场直播 / 星图模板 / 用户群)。主号讲方法论、企业号讲这个,双号分工。 |
00:00如果你一直想学AI视频却不知道从哪里开始那这门影视飓风AI实战课就是为你准备的49元我们把影视飓风在AI创作中的所有经验浓缩成16节课程带你从零开始建立AI创作思路教你如何把想法变成画面以及如何让AI更懂你的需求
00:15还有一步步做出属于你自己的专属AI视频为了让你真正能够做到边学边练我们还准备了价值200元的课程专属AI更练室让你不用担心练习成本学完之后如果还想继续创作我们也准备了专属的优惠礼包帮你以更低的成本体验更多的优质模型
00:31去实现你天马行空的创意除此之外你的作品还能够参加课程同款生成平台举办的专属AI创作比赛所以希望这门课能够成为你AI创作的开始我们课上见
| 钩子原话 | 「好,各位我是 Tim。前几天我们上线了影视飓风 AI 实战课……视频上线之后受到了很多朋友的认可和肯定」——先致谢、后转折,把差评视频包装成感谢视频。 |
|---|---|
| 结构骨架 | 0-15s 致谢:复述上新+感谢信任支持 15-22s 正面点名差评:「但同时我们也收到了各种各样的反馈,其中大家最关心的就是 AI 跟练室自由度的问题」 22-40s 解释而非辩解:成本很高 / 要让大家能稳定复刻 / 又不能被黑产侵扰「导致我们直接破产」——把限制讲成保护用户的无奈 40-55s 宣布已修:解锁创作自由度,可偏离课程原提示词,并用画面举证「比如这些、这些、这些」 55-68s 安抚已购:新版上线会重置生成次数,每位学员都有新的创作机会 68-80s 加码预告:8 月更新第一节免费 DLC 加餐 80-88s 再次致谢+「我们课程里见」 |
| 成交动作 | 全片零报价、零挂车。成交动作是给未购买者看售后姿态——这条的真实受众不是学员,是还在犹豫的人。 |
| 金句 | 「不被黑产侵扰导致我们直接破产」(自曝经营压力换共情)·「我们会重置大家的生成次数」(补偿先给足) |
| 可抄给 Mars | SaaS 发版视频的四段式直接照抄:致谢 → 点名当期最大差评 → 解释成本/技术原因(自曝一点脆弱)→ 宣布已修+老用户补偿+下一版预告。Mars 是订阅制,每次发版都能出一条,是全站最便宜的信任内容。 |
00:00好各位我是Tim前几天我们上线了影视飓风 AI 实战课教大家从零基础开始学会图片还有视频生成视频上线之后受到了很多朋友的认可和肯定非常感谢各位的信任和支持但同时我们也收到了各种各样的反馈其中大家最关心的就是我们的 AI 跟练室自由度的问题
00:17我们最初设计 AI 跟练室的目的是希望各位能够自己不花额外的钱跟着我们的课程一步一步把这些图片和视频生成下来这里面的成本其实还是非常之高的为了让各位能够稳定地复刻课程中的画面不产生太大的偏移又不被黑产侵扰导致我们直接破产
00:35所以我们对提示词等功能做了一些限制那当然我们现在听到了很多关于 AI 跟练室的反馈也经过了各种防护的加强所以我们即将推出课程的第一版更新我们现在可以开始解锁 AI 跟练室的创作自由度了你在创作的时候会拥有选项
00:51可以一定程度偏离课程原本的提示词来探索更多的可能性进行练习比如这些 这些 这些都是开放之后你能够做到的那已经使用过跟练室的同学之后可能会说那我怎么办不用担心新版上线之后
01:06我们会重置大家的生成次数让每位学员都拥有新的创作机会同时也预告一下我们将在8月份更新我们第一节免费的 DLC 加餐内容会有更加进阶的课程内容带给各位那最后再次感谢各位一直以来的支持还有提出的每一条宝贵意见
01:21我们在不断听取大家的声音不断优化我们的产品和体验那么我们课程里见抖音
| 钩子原话 | 「我的天哪,这条视频我看了整整五遍。这个叫 Cena Reis 的大胡子老外,用 AI 在 30 天内赚了 270 万美元。但这不是重点,重点是他用的方法 90% 的人可以复制」——三段钩:我的震撼 → 具体金额 → 「但这不是重点」把注意力从奇迹拽回方法。 |
|---|---|
| 结构骨架 | 0-13s 三段钩:看了五遍 → 30 天 270 万美元 → 「但这不是重点」转折 13-36s 承诺+收藏钩:「我连夜翻译了视频,把整套 AI 赚钱流程都拆解出来」「这条视频价值 1000 万,点赞收藏」 36-60s ① 锁定蓝海:谷歌趋势看「普拉提」搜索量逐年上升、年增长 11.5%;反面警告「绝对不能进停滞或衰退的市场,在那里你只会迎来内卷和亏损」 60-107s ② 卖什么(标题里那个"神级问题"在这里兑现):去 YouTube 搜「普拉提女孩的一天」,不看视频,把高赞视频的字幕全扒下来丢给 ChatGPT,只问一句「列出这些视频中所有被提及的商品名称」→ 得到普拉提防滑袜 → 再回谷歌趋势验证 107-160s ③ 发现「品牌真空」:插播原视频片段让观众自己听——女孩们说的是「我需要防滑袜」而不是「我要买 Lululemon 的防滑袜」;然后给出可背诵的定义,还加一句「我建议你记在手机的备忘录里」 160-232s ④ 设计品牌:让 ChatGPT 从文案提取用户身份标签 →「that girl」→ 再问「有哪些品牌符合 that girl 的调性」→ Glossier → 扒它的视觉风格(云彩天空背景、粉白配色)搬到自己的产品和官网;品牌命名一语双关;故意留悬念(「翻译成中文的答案我不告诉你,你自己试」) 232-252s ⑤ 生产:阿里巴巴国际站找供应商下单,产品图和品牌网站也全用 AI 生成 252-285s ⑥ 获流量:先用「三秒病毒法则」做一条短视频拿到 210 万播放,再只对看完 95% 进度的人投定向广告,转化率 7.19%(行业均值 1-2% 的 3-5 倍) 285-320s 收尾:4 月单月销售额 271 万美元 → 归纳三点方法论 → 「这套方法普通人完全可以复制」 |
| 成交动作 | 正片零推销。三个钩子分工明确:「这条视频价值 1000 万,点赞收藏」=明示收藏(收藏 34.7 万,几乎追平点赞);「答案我不告诉你,你自己试」=评论钩(评论 5448);课程/社群在评论区与主页承接。 |
| 金句 | 「但这不是重点,重点是他用的方法 90% 的人可以复制」·「他问了一个神级问题」·「品牌真空——消费者有明确需求,但市场上还没有一个占据心智的品牌」·「AI 绝对是我们这个时代普通人最大的红利」 |
| 可抄给 Mars | ① 钩子公式直接套:具体金额+反差品类+「但这不是重点」——Mars 版:「一场直播成交 X 万,但这不是重点,重点是他只让 AI 回答了一个问题:这 1000 个观众里谁值得跟进」;② 把方法命名——「神级问题」「品牌真空」「三秒病毒法则」,命名过的方法才会被转述和收藏,34.7 万收藏就是被这几个词带的,Mars 也要有自己的名词(比如「关系真空」「跟进窗口」);③ 插播证据让观众自己判断(「你仔细听听他们怎么说的」)比你替他下结论更有说服力——你们放弹幕原文截图就是这个用法;④ 留一个不给答案的小悬念做评论钩;⑤ 全片是拆解别人而不是夸自己,和 ⑤ 同一路数——这是软件类账号最安全也最好用的选题结构。 |
00:00我的天哪 这条视频我看了整整五遍这个叫Cena Reis大胡子老外用AI在30天内赚了270万美元但这不是重点 重点是他用的方法90%的人可以复制看完后我真的是心潮澎湃
00:15在视频中他分享了如何用AI策略去找到一个稳健上升同时又没有龙头品牌的蓝海市场以及更重要的是如何找到你精准的营销对象并根据他们的需求去设计产品最终买报我连夜翻译了视频
00:31把它整套AI赚钱的流程都拆解了出来这条视频价值1000万点赞收藏第一步用AI锁定高增长蓝海市场这个大胡子说你要找到一个不断增长的蓝海市场绝对不能去进入一个停滞不前或者衰退的市场
00:47在那里你只会迎来内卷和亏损而他之所以选中普拉提市场是因为在谷歌趋势上他发现普拉提这个关键词的搜索量一年比一年高普拉提市场的年增长率达到11.5%确定了大方向接下来就是最关键的第二步
01:02在这个市场里到底卖什么他对AI的用法真的绝了他直接去油管搜索普拉提女孩的一天找那些点赞高的播出视频注意他根本没有自己去看完这些视频而是把那些长视频的字幕文案全部扒下来
01:18一股脑丢给ChatGPT然后他问了一个神级问题列出这些视频中所有被提及的商品名称就这一个提示词ChatGPT直接给他列出了一份完整的产品清单其中一个产品引起了他的注意普拉提防滑袜
01:34他立马回到谷歌趋势发现普拉提防滑袜这个词的搜索量也是持续上升的我看到这里真的是贵了这种用AI进行市场道远的方法效率比人工高100倍而且完全客观不带任何的主观偏见第三步发现品牌真空
01:50这个就是印钞机密码接下来他做了一件更聪明的事他去看那些精致女孩对普拉提防滑袜的评价我把原视频放出来你仔细听听他们是怎么说的听出来了吗
02:11女孩们说的是我需要防滑袜我要买防滑袜而不是我要买Lululemon的防滑袜我要买耐克的防滑袜看到这里这哥们直接兴奋了他当时就说了一句话我建议你要记在手机的备忘录里当一个产品在市场上还没有强势品牌的时候
02:27这就叫品牌真空这就是最好的机会什么意思就是消费者有这个明确需求但市场上还没有一个占据心智的品牌这个时候谁先做出来谁就能强占用户心智成为这个品类的代言词那现在问题来了
02:43怎么设计一个让这些女孩疯狂下单的品牌AI再次派上用场它让ChatGPT去分析那些视频文案然后提取目标用户的核心身份标签ChatGPT告诉她这群女孩的身份认同是that girl就是那些生活精致 自律
03:00喝着健康的果西坚持健身的理想女性形象接着她又问了Chad Gibbett一个绝妙的问题有哪些品牌符合that girl的调性Chad Gibbett给出了答案Glossier这是一个高端的护肤品牌她二话不说 立马去扒Glossier的官网
03:18然后发现他们的视觉风格是梦幻的云彩天空背景配色是温柔的粉白色系他就直接把这套美学风格抄过来用在了自己的防滑滑设计和品牌网站上然后他给这个品牌取了个名字叫Garandit这个词太妙了
03:34既代表袜子的功能防滑踩在地上踏实又暗示了普拉提运动的扎根和稳定的理念一个名字把产品功能和性感价值全说清楚了我还自己问了一下ChatGPT如果把Garandit翻译成中文你应该怎么翻译
03:49他给我的答案非常绝但是我不告诉你你可以自己试一下第五步找供应商生产有了设计方案之后下一步就是找供应商来生产去哪找阿里巴巴国际站没有拿广告费他拿着AI帮他设计的防滑滑方案找供应商直接下单生产
04:06同时用AI快速生成了产品图片和品牌网站连网站都是AI做的产品和网站都有了最后一步就是获取流量他没有像大部分人那样上来就砸钱去投广泛流量而是先用三秒病毒法则做了一条短视频
04:22就是这条结果这条视频直接爆了拿到了210万的播放视频火了之后他做了一个超级精准的操作只针对观看了他爆款视频超过95%进度的人去打定向广告结果广告转化率直接飙升到了7.19%
04:40要知道电商行业的平均转化率也才1% 2%他直接干到了别人的3到5倍仅仅4月份一个月销售额就高达271万美元这绝对是我今年看到的最好的AI电商实战案例也是艺人公司的经典打法
04:56它的方法论核心就三点首先是用AI加数据去找到蓝海市场而不是凭借个人的感觉或者喜好第二用AI去分析用户需求找到品牌真空第三用AI体效从选品到投流到生产全程AI辅助
05:11而最关键的是这套方法普通人完全可以复制我坚信AI绝对是我们这个时代普通人最大的红利翻身的力气
| 钩子原话 | 「今天给你拆解用 AI 做猫咪日常生活 Vlog——一条作品点赞 20 万,半个月不到,六条作品涨粉 1.8 万」——6 秒钩子里的战绩是别人的,不是自己的。 |
|---|---|
| 结构骨架 | 0-6s 拆解承诺+别人的战绩数字 6-11s 合规免责:「首先声明,本视频仅做拆解教学分析,没有任何不良引导」 11-38s 直接播放原作者视频,让观众先看到成品 39-65s 拆"为什么火":「绝对不是靠运气,也不是单纯靠猫咪可爱,而是把萌宠当成真人大学生做叙事」,用细节戳集体记忆 65-110s 三个可复制亮点:① 人设精准落地(定死"内向社恐小猫大学生",社恐贯穿全片:出站人多、不好意思问路、室友没话聊)② 魔性洗脑配乐 ③ 系列化埋钩(结尾预告下期,解决萌宠号涨粉留粉难) 111-127s 打消门槛:一部手机+剪映,新手半小时出一条初稿 130-640s 实操教程:生成 Vlog 脚本(把完整提示词逐字念出来)→ 生图 → 生视频 → 剪辑参数(1080P / 60 帧)→ 导出成片 687-760s 变现六法:中视频计划千次播放 1-8 元 / 挂车带货 / 账号矩阵(社牛布偶猫、卷王金渐层、摆烂蓝猫) 759-774s 双重 CTA:资料包+一键三连 |
| 成交动作 | 「超详细的操作文档、提示词模板,我已经打包好放到工具箱了」——全片说了两次(第 134 秒一次、第 761 秒一次),开头埋、结尾收。产品就是那个资料包,靠它把公域洗进私域。 |
| 金句 | 「能火绝对不是靠运气,也不是单纯靠猫咪可爱,而是把萌宠当成真人大学生做叙事」·「制作门槛极低,一部手机加剪映,新手半个小时就能出一条初稿」 |
| 可抄给 Mars | ① 拆解别人的爆款,比夸自己的产品好卖——用 Mars 去拆一个别人的直播间/账号,产品在拆解过程里自然出场,全片不像广告;② 开场甩的战绩要是别人的数字,观众才不设防;③ 资料包钩子在开头和结尾各说一次,别只说一次;④ 那句免责声明必须抄——你们做对标拆解内容,一句话就把合规风险降下来。 |
00:00今天给你拆解用AI做猫咪日常生活Vlog一条作品点赞20万 半个月不到 六条作品斩粉1.8万大家好 我是天线首先声明 本视频仅做拆解 教学分析 没有任何不良引导我们先来看一段原作者的视频内向小猫勇闯大学生活
00:15开学片那么这个原视频的话我们已经看完了
00:39我们来解析一下这个账号这个作品的话呢是通过大学生开学用AI做成一个女人化的一个猫咪开学的全过程这个作品能火的话绝对不是靠运气也不是单纯靠这个猫咪的可爱而是把猛宠当成真人的一个大学生做叙事
00:54视频涵盖了开学准备 旅渡见闻 校园生活等多个方面内容的话是保存的饱满贴近现实 能引起大学生的一个共鸣用细节戳中集体记忆引发共鸣创作的话呢有几个亮点啊也是新手可以直接复制的一个底层逻辑
01:09人设精准落地给猫咪定死内向色恐小猫大学生标签全程围绕着色恐展开剧情啊出口站人多犯色恐不好意思问路室友见面没话聊性格标签贯穿始终比这个单纯的一个可爱的小猫是更有记忆点的啊
01:29包括后期的一个配乐啊也是非常的有魔性很洗脑的一个配乐系列化的一个叙事埋钩啊就是视频的结尾直接预告下期解锁均序的一个新体验用大学生的一个生活经典场景做内容连载
01:45就引导粉丝关注追根解决这个萌宠账号一掌粉流粉男的一个问题啊重点来了啊这个制作门槛极低AI生成的猫咪加上后期的一个配乐加字母不需要复杂的运镜啊
02:00也不用专业的一个场景一部手机加上剪音就能做啊新手半个小时就能出一条初稿那么像这种视频怎么去制作呢超详细的一个操作文档提示是模板我已经打包好放到工具箱的低调学习那么我们来实操教程
02:15第一步生成Vlog脚本打开这个AI打开AI工具之后呢输入这个提示词你是一个世界顶级的AI视频导演与高级提示工程师啊同时也是一个极懂短视频网感大学生日常第一视角Vlog学习的一个工程师第一视角Vlog叙事的分镜测试专家
02:31你上传根据用户的提供的一张或者多图片精确的一个提取角色外貌啊还有我们的一个材质服装配饰场景镜头风格与情绪的一个氛围并在最大程度的保留原图视觉的特征前提下自动的一个展呈一套有趣连贯真实适合AI生成正常化的一个Vlog视频脚本
02:52为什么我们要给这个AI带入这个角色呢就是因为他能更好地完成我们要求需求的一个Vlog视频脚本啊然后核心任务这一块的话呢就是用户通常会上传一张图片偶尔会附带极简的一个要求
03:07你必须基于图片内容输出一套完整的可以直接用于AI生图生视频的一个真人化Vlog脚本方案即使主体主角本体是猫动物玩偶Q版形象也必须保留其原视觉的一个辨识度但叙事方式的话呢
03:23要当成真人大学生年轻人的一个Vlog来设计这个的话呢就什么意思呢呢!就是说你不单单只是宠物动物就主要是你想做的Q版一个形象啊动漫啊卡通啊都可以用到这一套提示词就什么火
03:38你可以做什么但是这个东西要发挥你自己的一个充分的一个想象那我们下面这些的话呢就是这个提示词的一些细节啊都已经调试好的了然后我们发给这个AI之后啊他会让你上传任意一张图片啊就是任何的一个动物
03:54你觉得自己想做的都可以上传上去然后AI的话就会输出视频的一个核心人设完整的一个分镜脚本还有全程大学生真人的一个日常逻辑啊这边的话我是上传的一个这个菊猫啊小菊猫的一个图片啊
04:10你们可以做小猫的小狗的都可以啊这个就发挥你们的一个充分想象啊上传这个图片之后呢这个就是我们的一个主题了这个菊系奶萌大学生啊这些都是一些特征啊视觉特征然后这个下面的话呢
04:25就是我们完整的一个分镜脚本啊可以看我们的个进口啊镜头一啊早吧起床啊鱼眼贴脸的一个自拍啊鱼眼超广角的一个镜景啊包括这些画面的一个内容啊台词啊氛围啊生成的一个体试词啊这些都是很完整很详细的
04:43我们可以看一下这些镜头台词画面内容啊有没有什么问题可以看一下这个完整的一个分镜脚本啊已经生成出来了我们可以去进行第二步了那么第二步的话
04:58是生成图片的一个提示词啊继续给AI输入提示词把每个分镜啊都写出这个画面生成中文的一个提示词啊并单独的生成猫咪形象提示词保持每个分镜猫咪的一个样子的形象了都是统一一致
05:13那么我们打开这个AI工具啊输入这个提示词把每个分镜都写出画面生成中文提示词啊并单独生成猫猫形象的一个提示词保持每个分镜的一个小猫咪的一个样子啊形象是要一致的然后发送给然后就出来了我们要的一个生成画面的一个提示词啊
05:33可以看一下我们的一个镜头镜头一镜头二啊都已经很详细的生成出来啊可以看一下这个画面提示词如果没有问题的话我们就可以进行下一步了可以去把这个画面提示词完整的复制下来去AI里面去把它生成的个图片
05:51那么我们打开AI工具之后呢把这一段提示词发送给AI把每个分镜都写出画面生成中文提示词啊并单独生成猫咪的一个形象提示词保持每个分镜猫咪的样子形象都要一致啊这个是一定要一致的
06:07要不然生成出来的这个画面生成出来的图片的话你调起来的话就很头痛啊然后发给AI之后呢这个就是我们的一个提示词啊猫咪的一个提示词然后下面的是生成出来的一个分镜画面中文提示词啊
06:23这个镜头一啊早上早八起床是吧语言的一个贴点词啊直拍画面提示词啊这个是镜头二画面提示词镜头三镜头四镜头五镜头六啊这些都是很详细的啊第三步生成分镜图片啊
06:39全选我们刚刚分镜图片的一个提示词哈然后我们打开AI工具啊把刚刚复制的提示词哈全部粘贴到这个AI工具软件里面啊然后发送给AI选择这个模式啊其他的不用选了就选这个然后的话呢AI会一次性直接生成十个分镜的
06:58一个图片啊这里的话我是有去除掉一个的这个的话也不行啊因为有一些他生成出来的并不是你想要的达不到你要求的你要单独把那个提示是修改然后再重新去生成一个你看这些都是我修改过的
07:13重新生成出来的一个内容然后我们检查一下我们生成的这个图片啊十个分镜的一个图片没问题之后呢我们就去下一步了生成我们的一个视频第四步啊我们去生成视频啊我们继续给AI输入提示词我们输入生成每个画面的视频动态生成提示词啊
07:30这个是我们的一个要求啊然后下面的话是生成出来的一个分镜的一个动态提示词视频动态提示词可以看一下啊OK我们这个动态提示词已经有了我们就直接给他复制下来然后打开其木这个是我们生成出来的一个图片啊
07:47然后点进去点这个生成视频啊然后把我们这个提示词粘贴进来这里已经有这个图片了然后选择这个图片生成然后点这个啊最好的话就是一点零这两个都可以啊这个都可以啊如果说你们想要好的就2.0 1.5%都可以
08:05但是这种的话他是要排队时间比较长然后成本也比较高这种排队像2.0比较火的排起来的话可能要几天时间太长了也等不了而且成本也高我教的都是成本比较低的成本很低马上就能做出视频的这种啊然后啊
08:20这些有什么元素啊你们要去添加的可以自己自由发挥啊然后相同的啊然后把另外一个提示词生成了啊生成了复制在这里生成了一样的然后下面的话我们这个提示词啊生成出来的一个视频啊要检查一下啊看一下哪些不满意的啊
08:36可以给他重新编辑然后再次生成一下主要是我们要看这个视频的一个质量怎么样啊如果不行的话那我们就要重新去做啊就千万不要去勉强啊我们的质量的话要慢慢的去调整了那第五步的话就是剪辑成片了啊
08:51我们把所有的一个分镜视频啊都生成好了我们就把它全部导入到简易里面那我们就把它全部导入到简易里面我们所有的一个分镜视频都生成好了我们就把它全部导入到简易里面来啊然后按照这个分镜的一个顺序啊给他拖到下面的这个导轨来然后之后的话呢我们可以给每个画面去配一个音啊
09:09就好像这个他是早上早起有眼睛这样的一个音效啊我们点这个左上角第二个然后这里有个音乐库啊就这里搜索啊有眼睛有眼睛音效
09:24然后选择一个合适的或者是你喜欢的啊然后我们就把这个分镜视频我用的就是这个啊然后后面这些啊刷牙的音效啊还有比如说背景啊这个人多的是吧比较嘈杂的一个环境包括这种上课的音乐
09:41这些音效啊所有音效都有啊这个食堂吃饭的咀嚼的声音的啊包括这些彩地板的比较安静的这种声音啊包括这些都有啊所有的素材在这个上面都能找得到啊然后之后的话呢我们就是再配一个音乐啊
09:56背景音乐就你们喜欢什么样的你们都可以自己配啊这个文案的话呢在我们最开始生成这个提示词出来的时候啊他就已经有配到文案了我就是按照这上面的去加的一个文案啊我们可以发挥自己的一个想象啊我这个文案的话是比较随便的
10:13其实他这个AI生成的这些文案的话其实是不过关的啊那么你们自己的话如果觉得AI生成出来的不满意的我们可以自己去修改去添加因为这个AI的话是吧他是偏向想象力的嘛你的想象力越丰富对吧
10:29越抽象可能你的这个流量就会越好所以的话这个根据自己去制作就可以了其他的话没有什么问题了那我们直接导出视频就可以了导出怎么导出呢点那个右上角啊这里又导出两个字导出的话
10:45我们这里分辨率啊就是1080P啊然后帧率的话我建议就是60或者是120都可以正常的话就是60啊那我们直接啊导出成片我们看一下制作好的一个成片啊所以这个就是我们的一个设计
11:29那么像这种视频怎么去变现的我可以给大家提供几种思路啊全面录的一个变现方式就从新手到高阶双赛道红利全吃啊这个赛道的变现核心是某种家大学生的一个双赛道
11:45拥合变现方式啊比单赛道多而且粉丝越精准粉丝量越高你变现效率越高从新手的一个零基础到高阶的一个IP六种的变现方式按步骤来零成本也能起步啊新手首选就是你零粉低粉基础的一个流量变现
12:00加清带货嘛然后就是这个平台的流量分层可以开通抖音中视频计划蝴蝶号的流量组靠这个视频播放振用金千次播放一到八米单条爆款的一个百万播放就能直接变现啊我这边就不一一阐述了主要着重讲两点
12:16还有一个就是账号的去证就做不同性格跟专业的不同专业的一个宠物大学的账号比如像那个色牛布尔猫还有卷王金剑城啊百烂蓝猫这种就批量放大流量跟变现的效率嘛核心就是创新方向结合这个AI做差异化嘛
12:32刷一开同质化你才能在一片赛道里面脱颖而出反正大家可以参考我这几个方向去做自己的一个创新啊那么超详细的一个操作文档还有这个提示时的模板我已经打包好放在工具箱了新手小白也能直接上手大家直接干就完了那么本期到此结束
12:48如果大家觉得天线分享的内容有所收获的话可以给我一键三连点赞关注收藏谢谢大家那我们下期再见
| 钩子原话 | 「后半生的不打工自由计划已经实现一半了。23 年的我只是一个啥都不会的裸辞伤心人,靠接各种小单搞副业,现在每月都有稳定的五六位数进账」——身份反差+具体数字,12 秒讲完一个人生翻身。 |
|---|---|
| 结构骨架 | 0-12s 身份反差自述:裸辞伤心人 → 月入五六位数 12-16s 承诺交付:「这期就把我的所有攻略整理成清晰的步骤给你讲明白」 16-35s 真干货①:自由职业/远程工作网站,现场打开演示 35-45s 真干货②:传统招聘软件搜关键词、求职类型改兼职,「用上我的打招呼模板」(私信钩) 45-52s 打消门槛:「根本不要去纠结什么技能门槛,基础类事务靠 AI 辅助都能完成」 52-80s 产品植入:AI 天团 Tbox 演示完整工作流——输需求→生成待办清单→确认后分发给各智能体→右侧同步看它们在读什么资料→代码生成排版的 PPT「绝对不会有套模板的嫌疑」→ 还能把干货做成播客 80-95s 价值观收尾:金句 × 2,供截图转发 |
| 成交动作 | 全片不喊买。真正的转化钩是那句「用上我的打招呼模板」——模板在私信/评论区领,把公域流量洗进私域。 |
| 金句 | 「有 AI,一个人就是一个团队」·「时代的浪潮从不会卷走冲浪的人」·「能快速搞定生产、交出成果的人,永远都是市场上的稀缺资源」 |
| 可抄给 Mars | ① 先白给两段真干货再植入工具——观众白嫖得到了,才允许你打广告;② 产品演示要演工作流全程(下需求→看它干活→出成果),不是罗列功能;③ 结尾放一句可截图的价值观金句:这条转发 8514、收藏 3.2 万,是被金句而不是干货撑起来的。 |
00:00嗨 后半生的不打工自由节已经实现一半了23年的我只是一个啥都不会的裸词伤心人靠些各种小单搞父爷现在每月都有稳定的五六位数进账这期就把我的所有该破整理成清晰的步骤给你讲明白我们先来学习如何寻找那些更自由的远程工作
00:15来 这些都是非常垂累的自由职业网站我随便演示一个打开请看 这些除了不用做班它就是一份正常的普通工作还有这些传统招聘软件直接搜索关键词或者把求职类型改为兼职诶 打开新世界这期根本不要去纠结什么技能门槛问题
00:32用上我的打招呼模板什么岗位都去投一遍因为目前自由职业能干的各种基础类事物你靠AI辅助都能完成上个月成立了自己的公司更能清晰地感受到有AI一个人就是一个团队的含金量我用最新的AI天团Tbox给你演示一遍我的工作流
00:47比如这里我要用它做个员工培训PPT只需要简单输入我的需求它就会快速生成一个代办清单给我确认确认完后自动把任务发放给各个智能体右边可以同步看到他们在阅读什么资料工作进度如何最喜欢的是它这个排版它是根据需求生成代码再排版的
01:02因此绝对不会出现套模板的嫌疑整体视觉效果都比较高级适合商业用也适合你摸鱼的时候用除此之外诶 这个功能太牛了Tbox可以给你做播客对 就是那种你上下班可以听的干货资讯现在已经很少边走路边听歌了我都在赚钱
01:18我一直是市面上出了什么AI新品就一定会抢先用花样用的人根本没空去担心什么AI会不会取代人类因为我相信时代的浪潮从不会卷走冲浪的人特别是现在自己开了公司站在自由职业的市场上更能体会能快速搞定生产交出成果的人
01:33永远都是市场上的稀缺资源德音
| 钩子原话 | 「如果你现在一个人、没有团队、没有资源,也没有很好的计算机基础,但是你想在本职工作之外用 AI 做一个副业——今天这条视频,我会手把手带你拆解一个任何人都可以做的一人公司模式」——四重「没有」精准圈人。 |
|---|---|
| 结构骨架 | 0-13s 四重「没有」点名人群 + 拆解承诺 13-17s 先撇清:「首先声明,今天不是来吹我自己做得多好,然后给你卖课程」——10 分钟长视频能留人的前提 17-49s 立案例:博主「花生」用 AI 做「小猫补光灯」App 冲上 App Store 付费榜第一 → 借热度做个人账号 → 涨粉 → 付费社群 → 数字游民 49-86s 现场演示:豆包电脑版 AI 编程,「不需要懂计算机,也没写过一行代码」,用大白话描述就复刻出同款功能 87-115s 给理论框架:项目三要素=想法/产品/运营;没有 AI 时「想法和产品之间永远隔着一条普通人越不过去的河,就是技术」;AI 填平了它,所以真正值钱的只剩有价值的想法 + 运营策略 116-240s 第一步 向内挖掘:「只要你上过班、领过哪怕一个月工资,就说明你的某项能力已经作为产品卖给了老板,价格就是工资」→ 找优势(职场技能/信息差/玩了十年的爱好)→ 必须和一个细分热门话题结合,用两个类比论证(三年前做付费榜第一有人看吗 · 番茄炒鸡蛋 vs 十块钱搞定一家人的晚餐) 241-460s 第二步 把自己产品化:出镜做账号——「出镜的账号叫 IP」,这才是有杠杆的动作 460-550s 第三步 系统化:每天固定 2-3 小时做销售与服务;把找选题/写文案/做视频/剪视频固化成 SOP(涉及智能体与工作流);虚拟产品以双周为单位迭代;时间不够就外包或让 AI 当数字员工;最后做个人独立站防平台风险 512-525s 定义金句:重新定义「一人公司」 552-605s 收尾:预告豆包编程新版本(软广落点)+ 行动号召 |
| 成交动作 | 开头明说「不卖课」,全片确实无挂车、无报价。真正的植入是工具本身——豆包编程出现三次(复刻 App、生成独立站、结尾预告自己拿到新版内测)。收藏 1.95 万、转发 5920 对 2.7 万赞,是方法论型长视频的典型结构。 |
| 金句 | 「想法和产品之间,永远隔着一条普通人越不过去的河,就是技术」·「只要你领过哪怕一个月工资,就说明你的某项能力已经作为产品卖给了老板」·「一人公司不是让你一个人去运营一家公司,而是以你这个人为核心构建的商业模式——什么都可以用 AI 代替,什么都可以花钱找人解决,唯独缺了你这个人不行」·「只有最多不超过 1% 的人会真正去行动,而只有行动,才能把一个契机变成一个奇迹」 |
| 可抄给 Mars | ① 开场先撇清「我不卖课」,观众才肯听完 10 分钟;② 给一个可命名的框架(想法/产品/运营三角)——有框架的长视频才会被收藏,没框架的只会被划走;③ 软广的正确姿势:工具在演示里出现三次,但全片讲的是方法论不是工具;④ 最后那句定义几乎是替 Mars 写的——「以你这个人为核心构建的商业模式」,你们卖的关系资产正是「缺了你这个人不行」的那部分,这句可以直接拿去当品牌片的收尾。 |
00:00如果你现在一个人没有团队 没有资源 也没有很好的计算机基础但是你想在本职工作之外用AI这个新东西去做一个副业那今天这条视频呢 我会手把手的带你拆解一个任何人都可以做的一人公司模式首先声明啊 今天不是来吹我自己做的多好 然后给你卖课程
00:17整条视频围绕的都是一个我自己很喜欢的AI博主 他叫做花生去年的时候呢 这个博主用AI做了一个叫做小猫补光灯的APP这个APP呢 在当时冲上了APP Store付费排行榜的第一名并且这个事件在当时的红薯平台上面引起了一段时间的讨论
00:33然后就是关键了这个博主依托当时这个热门话题迅速做了自己的个人账号并且很快就收获了大量的粉丝然后他就围绕这个账号来构建了自己的商业模式比如说这种付费社群成为了很多人羡慕的不用上班的数字游民
00:49我先来说他这个APP是怎么做的这个软件其实功能上非常的简单就是一个可以调节屏幕颜色的程序用户可以通过手机的光来给自己拍照的时候进行补光我们打开豆包电脑版进入AI编程不需要你懂计算机也不需要你写过任何一行代码
01:05就像你平时和豆包聊天一样直接把你想做的产品用大白话告诉豆包就可以比如说我输入这样的一段提示词很快豆包编程就可以帮我们写好代码并且把程序的前端页面和交互逻辑直接给到这里可以看到基本上小毛补光灯里面的屏幕颜色
01:22和亮度调整功能全部都有了屏幕中间也按照我们的要求留出了相框的位置一般来说我们做一个项目核心的元素只有三个点想法 产品和运营在没有AI的时候想法和产品之间永远都隔着一条普通人越不过去的河
01:39就是技术连产品都没有那就更别谈运营了而像豆包编程这样的几乎毫无入门门槛的AI其实就是填补了把一个想法变成产品的这条鸿沟所以在这个铁三角里面真正重要的是一个有价值的想法
01:54以及运营策略所以具体怎么搞我总结下来其实就三个步骤第一步我觉得你要充分的向内挖掘只要你上过班领过哪怕一个月的工资就说明你的某项能力已经作为产品卖给了你的老板
02:09价格就是每个月他发给你的工资既然这项技能能够卖给老板那就一定可以卖给其他的人所以当你下定决心要成为一个超级个体的时候要做的第一个动作就是找到你有什么优势可以是在职场上习得的一个技能
02:24可以是某个领域的信息差甚至可以是某个你玩了十年比大部分人玩的稍微好一点的一个爱好然后还有一个非常容易忽视的环节就是要找到一个细分的热门行业或者话题和你的优势去进行结合
02:40那什么叫热门话题呢AI算不算新能源汽车无人驾驶算不算消费降级职场内卷学历贬值算不算你想一下如果是在三年前谁做了一个APP付费榜第一的产品会有人看吗会有但一定不会多
02:56但是花生这个博主呢他是在2024年用的是现在最火的AI一个人做了一个出圈的产品这个才是爆火的本质再打个比方啊假如说你的优势是做饭你觉得是买一堆高级设备去拍番茄炒鸡蛋
03:11更有可能出圈还是去拍10块钱搞定一家人的晚餐一只虾做了三个菜更有可能火当你把这个环节想清楚了啊你其实已经超过了至少80%以上的人现在你只需要去思考两个问题第一个你能不能通过一个作品
03:27或者一个事件去找到对你的技能或者信息差有需要的那一拨人第二个问题除了你的长板和优势其他的技术环节或者说你的短板怎么样用AI或者其他的外部能力帮你去补齐花生他之前是做产品经理的
03:43所以根据客户的需求构建一个产品然后去运营去迭代去盈利本身就是他擅长的东西但是他以前在大厂打工做一个产品是需要一个团队要开发要设计要运维的但是AI的出现
03:58让他一个人就可以把整个链路跑通好再来说第二个环节就是把你自己产品化这里我来做一个假设如果你今天用AI做了一个产品明天就登上了排行榜第一名或者说喜欢电影的你用AI做了一个短剧
04:14然后上了热门接下来你会做什么动作我相信绝大多数人可能就会发个朋友圈或者说趁热打铁再去做第二个作品而花生这个博主呢他就做了一个有杠杆的动作自己出镜去做账号注意啊
04:30这里的出镜非常的重要因为出镜的账号叫IP只讲干货的账号叫工具一个能够持续输出的IP不管在涨粉还是边线上都是工具账号的十倍以上而且他还会利用AI独立开发者这个身份
04:45去北大讲课去写书去参与一些有影响力媒体的分享会等等等等总之就是充分利用了这一个事件的常委价值所以我也想说的是你如果想不上班一个人真正的沉点事其实是需要在两个阶段要密集投入的
05:01要时刻保持兴奋不能睡觉的那种投入第一个就是把你的优势发挥到极致做出你的第一个出圈的作品一个让人共鸣的故事或者一个能够吸引到注意力的话题这个阶段其实叫做人机结合既需要你的思想也需要AI的辅助
05:17完成这个阶段以后你又会进入到下一个爬坡的关键阶段这里又有两个必备的动作第一个就是疯狂的输出内容就好比你开了一家烧烤店然后被你们那的电视台报道了门口来了一堆吃瓜群众看热闹
05:32这个时候你是不是要宣传一下你的菜不是玉式菜是不是要贴个海报说一下你家的羊是内蒙古的第二个关键动作是要搞出一个你的产品出来可以是一个课程一个社群或者是99块钱一个小时的付费咨询如果你有供应链的话
05:48也可以是一个实体商品在这个阶段你的面子对镜头的恐惧别人对你的看法包括你的生活都不重要了因为这可能是改变你生活状态甚至是人生规划的一个重要转折点你就拿你现在这个手机去拍不需要买新的手机
06:04不需要买新的设备把你的想法把你的观点都输出出去国足它没进世界杯你都可以拍一个视频疯狂的让自己像个产品一样曝光在公众面前记住啊你的第一个窗口期只有两到三个礼拜一个视检
06:19或者一条爆款短视频的热度不超过半个月就会过去这个阶段的目标呢其实总结下来只有一个就是正反馈这个正反馈最好是实实在在的能赚到一点钱当然啊也可以是收获到互联网上的陌生人给你的情绪价值
06:35或者是一些其他能够让你得到满足的东西因为等我讲完接下来第三个环节你就会体会到你只有持续能够拿到正反馈你才能够把这件事坚持下去好如果前面两个阶段你已经做到了那恭喜你
06:50你命运的齿轮已经开始转动了你已经具备了一个人不依赖一份工作就可以养活自己的能力在这个阶段我的建议是如果你的工作非常的痛苦或者说没有什么成长性那其实你完全可以辞职出来自己干但如果你的工作做的还不错
07:06我建议不要冲动辞职把线上的生意当成副业来做这个阶段的核心也是两个关键词运营和放大因为此时此刻你已经有了基础的粉丝或者叫做公众注意力你也应该有了一套做内容做产品的方法论
07:22你也有可能已经搞出来了一个1.0阶段的产品比如说一套还不够完善的课程或者是一个人数还不够多的社群也许你还有稳定的广告商每个月来找你做广告一方面你需要做的就是按时出摊你可能很长一段时间
07:37都不会再做出刚开始那样的优秀作品了而且如果你做的比较顺利的话这个阶段你每天可能需要花两到三个小时去给新的客户推销产品去给老的客户解决问题这个时候你就需要把你自己的工作流程梳理出一个SOP
07:53比如固定下来一个找选题写文案做视频剪视频的工作流程这里面一定会涉及到智能体或者工作流的应用你也不一定非要做出那种质量非常高的爆款因为此时你大概率已经在你的细分赛道属于一个小的KOL了
08:09基础粉丝和账号的权重都是有的只需要固定的时间去输出内容就可以了另外一个方面你要开始注重你的产品品质特别是对于知识付费或者社群这种虚拟产品你至少需要以双周为单位去迭代你的产品
08:25如果你的时间不够要合理的去找合作的外包公司或者用更多的AI工具成为你的数字员工请记住一人公司不是让你一个人去运营一家公司而是以你这个人为核心构建的商业模式
08:40什么东西都可以用AI代替什么都可以花钱找人解决唯独缺了你这个人不行再升高一个维度来讲你还需要考虑一个问题就是假如你脱离了平台比如有一天你的粉丝清零了你还能不能把你这个生意做下去
08:56这个时候你就可以去做一个个人独立站还是用豆包编程我输入这样的一个提示词就可以帮我去生成一个个人网站可以在上面做社群放你的课程或者是和别人合作去做资源整合新的平台向多个方向扩展你的影响力
09:12其实除了我今天说的这些内容AI还有无数种玩法能够让我们把一个简单的想法变成复杂的产品进而变成一个项目比如我今天说的豆包编程其实只是现有版本的功能目前我已经拿到了新版本的绘度了
09:27新版本除了用文字还可以用参考图来进行想法的表达将小想法转化成可以落地的创意方案而且会通过A型的智能体的植入通过自动调用工具来实现更复杂的自动化编程非常值得期待
09:42其实我今天讲的所有东西核心还是要有一次单点突破能够把视频看到这里的人可能会思考会点赞会收藏甚至今天晚上可能还会失眠也有人会觉得我讲的太理想化了落不了地但是当明天太阳升起的时候
09:58相信我只有最多不会超过1%的人会真正去行动而只有行动才能够把一个契机变成一个奇迹
| 钩子原话 | 报完六个产品名,直接抛决策题:「到底哪一个才是最适合我们国内新手小白的第一款 Agent 工具呢?今天我们来测评一下」——紧接第 11 秒「先放结论」,把排行榜甩在最前面。 |
|---|---|
| 结构骨架 | 0-10s 报菜名 + 决策型提问「第一款该选谁」 10-18s 结论前置:直接甩排名,并制造反差点「Cloud Code 居然这么低」「对啊居然第六名」——悬念放在开头而不是结尾 18-200s 逐款拆解,每款固定四件套:绑定哪家模型 → 优点 → 门槛/缺点 → 推荐指数打分 200-530s 国内产品线:应用生态、专家与技能、连接器、能否接第三方模型 530-570s 场景化建议:能直接集成进微信、想到什么一句话就办;但主动劝退——「我觉得你现在并不需要,可以完全把它当做进阶的选择」 570-619s 回顾排名+决策树:能解决门槛就选 A,解决不了就选国内的;并回扣开头那个反差「为什么它居然第六名——隐形门槛太多」 |
| 成交动作 | 无挂车、无报价。转化钩埋在一句闲聊里:「我们群里面很多人都在互相问,你用它干嘛、你用它做什么」——用群里的真实讨论证明社群值得进。全片真正在卖的是「跟着我选工具」的信任。 |
| 金句 | 「先放结论」(长视频留人的开关)·「它的隐形门槛实在太多了」·「今天这期视频,只针对国内新手宝宝的第一款 agent 软件」(反复收窄适用人群) |
| 可抄给 Mars | ① 决策型选题自带购买意图——做一条「AI 记忆工具,第一款该选谁」,把 Mars 放进对比场;② 「先放结论」+一个反常识排名,是 10 分钟长视频唯一能留住人的开场;③ 每款都用固定四件套讲(模型/优点/门槛/评分),观众才信你不是恰饭;④ 敢劝退比全都推荐更可信——对不合适的人明说「你现在并不需要」。⚠️ 片中对某厂商封号的指控是博主个人说法,抄结构不要抄这类攻击性表述。 |
00:00Codex Workbody Cloud Code Zcode Open Cloud Hermes到底哪一个才是最适合我们国内宝宝新手小白的第一款Agent的工具呢今天我们来测评一下先放结论可以看到Cloud Code其实还没是比较
00:15对啊居然这么低是的我们现在来详细分析一下每一款软件首先就是Cloud Code跟Codex它们两个是我们现在全世界上非常有名的两大软件了它们最大的特点第一就是它们是绑定自己家的模型的但是它们家的模型是目前世界上数一数二的
00:32宇宙最强对今天你方唱罢我上台先讲Cloud CodeCloud Code它们自家的模型一般来说是软件的第一名都会领先Codex半个身位同时Cloud Code是我们Agent界的鼻祖了它们家最早是以CRI形态出生的
00:48同时现在也推出了桌面端的形态但是我觉得它桌面端设计的其实不是非常的友好仍然是以开发者思路去做的再加上英文界面所以我觉得不是太适合小白去理解的而且它的很多功能你是在界面上看不到的
01:05它也不给你解释其实是的然后它们家的Agent的Hanis能力目前还是行业上数一数二的我们国内很多的Agent软件可以说是摸着它们俩过河的它和CodexHanis能力是什么意思呢就是对于大模型的约束和管控能力
01:21也就是说在保证了尽量释放大模型的强大能力的同时也尽量不要让它们去犯错同时用很多很多丰富的工具给AI让它们可以去帮助人类干活虽然没听懂但是很厉害的样子所以之前我们国内很多的开发者都是用Cloud Code
01:37然后去接入国内的模型去使用的因为它们的Agent软件能力真的很强但是为什么要接国内模型呢因为它们的门槛也就是它们的缺点这门槛有三个第一个就是上网条件这个不多说了第二个支付麻烦只接受国外的支付方式
01:53这个还算小点了都能解决最后一个最后一个是最大的问题这是Cloud Code独有的它背后的公司Astropic非常非常的针对我们中国人它会竭尽所能的去检查你是不是中国人一旦发现立马封号不管你这个账号充了200块钱
02:08还是1000块钱都直接没有了所以非常非常的麻烦这也是我为什么不推荐它小白来说它的推荐指数增加到2.5就没必要大家如果费尽心机去用它然后过两天给你搞没了可苦的很心累的好第二个CodexCodex现在其实应该改名了
02:24已经叫做ChatGPT了然后他们家的模型仍然是也是绑定的自己的GBT系列模型同时他们家模型在世界上也是不弱于Cloud他们家的它的价格会更低同时它给的Codec额度也更高再加上刚没有Cloud Code的第三个限制
02:39所以他们家的性价比是非常非常高的Codex不像Cloud Code那么专注于开发者ChatGPT也考虑到了我们的职场办公人士的使用场景可以看到它里面插件也有很多比如说文档PPT表格
02:54飞个马对这些这种办公领域的生态同时它的agent软件能力也是非常非常强的所以Codex我对它是非常非常推荐的但是它也有门槛它的门槛就是刚才前面的那两点第一访问的问题第二充值的问题
03:10这两个问题如果你能解决那我对它的推荐是第一名五星推荐第一名但是如果你都不知道我刚才说的第一个门槛是啥意思那对你来说可能它不适合你那就讲到我们第二款最推荐的软件就是我们国内的WalkBuddy
03:25是腾讯旗下推出的一款他们的模型生态是支持我们国内比较主流的开源模型同时它也支持你自己去接入第三方模型去使用那么首先我觉得WalkBuddy最大的优点是它里面的应用生态非常非常的丰富
03:41而且比如说里面的专家和技能都是有了很多除了软件开发还有很多生活类的场景的所以你可以看到翻都翻不完然后这个连接器是可以对接了现在几乎腾讯旗下各种主流软件生态做得非常好资源做得非常多
03:56是的所以我觉得这个对于不管是你是开发者还是职场人士这个都非常适合作为新手的选择那讲完优点讲讲我觉得它的缺点但这个缺点是主观的缺点并不是它的客观门槛以上只代表丁丁个人意见主要是它的
04:12软件的设计风格仍然是保留了腾讯之前那种腾力腾气的它把所有的功能全都铺在上面它认为它了解你然后它就做了一大堆功能然后而且还有很多各种各样的营销信息所以就觉得整个界面
04:27非常非常杂乱第二个它的软件设计团队我觉得还仍然停留在2C软件那一套设计理念上就是它觉得它非常理解用户然后它做了很多就是适合C端用户的那种功能但是现在是AI时代了我认为一个好的AI软件
04:43它的设计语言应该是2Agent的它的功能应该是面向Agent去提供的所以很多使用习惯了CoreCode或Codex的人去用一下WalkerBody就会发现它非常割裂你举个例子举一个形象的例子它们有一个项目功能这个项目刚才我漏提了
04:59其实也是WalkerBody的一个特色就是它可以支持多人在上面协同通过任务分发的方式来驱动整个项目的进度它的项目初始化的时候都会有一个文件空间里面都会默认放一个文档叫做资产空间使用指南然后当你在项目下
05:15和Agent协作的时候你会发现它的Agent对于它们这个项目的功能也不了解这个没问题它不了解的时候Agent待会它就会尝试去读这个资产下面的文档它也想去学习这个指南但是它们放的这个指南竟然是PDF格式的
05:30PDF是没有办法被AI直接读取的那它为什么不直接放巴克档呢所以我就觉得就是体现出了它们设计团队没有考虑这个Two Agent的设计理念它们的所有思路都是面向我们人类它没有考虑这个AI在里面如何使用的方便但是AI工作的不方便
05:46就是我们人类的不方便经常使用Codex你就会知道Codex有80%的功能你是看不到的Cloud Code也是这样这些功能都是在使用的在水下的不需要你人类去使用只有在AI会在觉得你需要的时候它自己去调用对对对是的有这种感觉
06:01但是WorkBuddy80%的功能都是在水面上这些功能你看的人类看的非常丰富但这些很多功能AI用不了就是我们人类要去选选择我们喜欢的分类各种都给我们看的对吧然后AI它自己不能帮我们去技能观察选择匹配的
06:16对 然后Codex的话甚至可以帮你操作绘画生成绘画绘画之间发消息这些WorkBuddy都是不行的但我爸有专家团他对于你这种新手小白他都把这些东西都帮你打包好了都帮你放好了但是我也不可以编辑里面的专家团我也可以调整是的然后在项目下
06:32你也没办法去自定义专家所以就是觉得懂了感觉很容易上手但是每迈一步都会被各种各样的门槛给阻住就是家长式的整天给我搞这个搞那个但是我就不想要我想自己搞我想让我的AI自己弄对 AI做不了好 我们吐槽完毕够了
06:47但是我觉得这些都不足以阻拦你们去用这款软件它仍然是我觉得是非常适合我们国内小白新手体制的一个暂时的天花板对 非常推荐你们去使用所以我对它的打分是四颗星也就是如果你
07:02搞定不了Codex的话你可以考虑考虑它很好了 已经很高了没收钱纯体验然后接下来就是我们的中庸层中庸层内有哪些呢有Tree然后有Zcode还有一些我们今天不会没举到的它们为什么比较中庸呢你们可以看到
07:17就是TreeTreeTree是火山旗下它们家其实做的也挺早了然后它们家的模型生态也是支持了现在国内主流的大部分的开源模型也支持你自己去添加第三方的模型然后呢它的技能生态相较于我把底来说就是少了很多了
07:33几乎都是一些火山旗下的或者是一些开源的也技能生态然后就是ZcodeZcode最近还比较火也是智普推出的它们家的特点有一个很奇怪的点就是它们家默认只支持自己家的JRM5.2或者JRM5但是你如果
07:48要用你得订阅它们家的coding plan你抢不到你又抢不到现在不能直接用吗现在默认的每日只有500万token其实是非常少的进阶的全部受信抢不到这就是最大的问题它们自己家的软件里面自己的模型你是用不到的你得自己去接第三方模型
08:04Zcode你可以看到它是没有技能生态市场这个概念的都传自己的对传自己的然后它有一点特色就是它是默认可以去集成到你的飞书或者微信里面去的这个还可以像JR也说也能给它0.5分的上浮但是其实也就仅此而已了
08:19其他没有什么特色了然后除此之外还有一些国内一些我们就不去美举了就是处于中庸层你可以根据自己的喜好去选择它然后最后就是OpenCloud就是我们的瞎和马养瞎养马这个在前段时间非常火但是它们的使用门槛非常非常高
08:35虽然像FirmisOpenCloud现在都推出了自己的桌面端但是它的桌面端上面也没有什么特别大的优势让你一定要去选择它如果你有能选得到它你也可以考虑CodexWorkBuddy了它们的特点是什么呢就是跟Zcode一样默认打通了即时通信软件的
08:50就是Codex它们也有移动端但是它们要用自己独立的APP去访问这样就会多一道卡让你平常觉得非必要就不会去用它对 要打开一个APP然后再聊是的 是的但是它们是可以直接集成到微信里面去的这样子你想到什么事想要它去做什么事
09:06只要一句话就能搞定了这就是它们特点但是我觉得你现在并不需要可以完全把它当做你进阶的选择现在的你呢其实是要去熟悉使用这些agent软件在你的办公的板定里面去找到这个成绩我们群里面很多人有养虾养马的人都在互相问你用它干嘛
09:21你用它做什么没有成绩是的所以大家可以先从我们比较推荐的软件先使用起来然后最后进阶的时候再考虑它或者考虑Code的这些OK那我们再回顾一下今天的排名其实如果你能解决一些小门槛的话Codex是我们的鼠推解决不了
09:36那你就适合我们国内新手宝宝体制的我可把你Codex如果你实在解决不了但又想使用它的话你可以接入第三方模型但是那样子的话就抹除很多它的那些官方特色它就会沦为和我们那些中庸层差不多的一个软件因为Codex如果它不是自己的模型
09:52有些功能是用不了的很多功能都用不了对像那个多agent的那些东西你根本换挤不了是的然后还有control use之间所以都用不了的其实Codex也没有了自己的优势到现在大家可以终于知道为什么一上来我们很惊讶为什么Cloudcore居然在第六名主要就是它的隐形门槛
10:08实在太多了是从你们的使用角度出发的对那今天这期视频只针对于国内新手宝宝的第一款agent的软件然后希望能够带给你帮助那今天的视频就这样拜拜
| 钩子原话 | 「Google NotebookLM,太炸裂了……它是个人数据库第二大佬。不,我只推荐一个功能」——情绪词开场,第 8 秒立刻反向收窄。 |
|---|---|
| 结构骨架 | 0-8s 点名软件+情绪词「太炸裂了」 8-12s 收窄:「不,我只推荐一个功能」——放弃全面性,换取记得住 12-25s 演示:贴一个视频链接,就能对这条视频提任何问题,小到几分几秒讲了什么、大到中心思想,秒回答 25-45s 二段加码:「真正炸裂的来了」——配合 Grabit 插件一次贴上百条视频,把某博主 153 个视频一分钟导入,之后可以任意提问、甚至给自己出题考试 45-50s 反问收尾「你敢信?」 |
| 成交动作 | 无成交、无挂车,纯安利。收藏 5.3 万对点赞 6.2 万——收藏率是这条真正的产出。 |
| 金句 | 「我只推荐一个功能」·「真正炸裂的来了」(二段加码的开关句) |
| 可抄给 Mars | 收窄式安利结构:一条视频只讲关系星图这一个功能,中段用「真正炸裂的来了」做二段加码——加码内容是「它连你三个月前直播里随口提过的那个人都记得」。50 秒、一个功能、情绪拉满,是 Mars 引流条的标准长度。 |
00:00再进一步用Google Notebook LLM 太炸裂了可能你在小地方听说了这个软件有好有壁它是个人数据库第二大佬不 我只推荐一个功能就是你可以把有关的视频链接贴给它然后就可以针对这个视频提任何的问题
00:18小到几分几秒 讲了一个还是太一次达到中心思想主要内容 秒回答然而真正炸裂的来了配合一个叫Grabit的小插件你可以一次性贴上百条视频给它比如这两年很火的一个博主Danko将一整期的一共153个视频一分钟导入
00:37然后你又拥有了它全部视频的所有信息你可以各种提列 终结提问甚至是对自己学习成功进行考试你敢信 这还要啥子执行才有
| 钩子原话 | 无口播开场,字幕驱动:ChatGPT / Banana / Midjourney / Leonardo / Gamma / NotebookLM / Suno / Soundful / 可灵 / Grok / MiniMax / Speechify / Claude / Kimi——16 秒念完 14 个工具名。 |
|---|---|
| 结构骨架 | 全片就一个动作:高密度报菜名,收尾一句「这个博主教会你以上所有 AI 工具」把清单换成关注。 |
| 成交动作 | 关注钩。收藏 2.7 万 > 点赞 2.3 万——收藏高于点赞是清单体的特征,用户是当资料存的,不是当内容看的。 |
| 金句 | — |
| 可抄给 Mars | 清单体唯一的 KPI 是收藏,不是成交,Mars 不该拿它当主力。真要做,做「5 个号称有记忆的 AI,只有 1 个真记得住」——把清单体和对比测评合并,才有转化。 |
00:00ChatGPT Banana Midjorny Leonardo Gamma Notebook LM Suno Soundful K-Aling Grok Minimox Speechify Claude Kimi这个博主教会你以上所有 AI 工具
| 钩子原话 | 无口播。全片 5 秒,靠标题贴片一句话完成表达:「我的员工越来越多了,但是分工明确」。 |
|---|---|
| 结构骨架 | 5 秒 = 一句拟人梗标题 + 一屏 AI 工具图标截图。零口播、零剪辑成本,内容就是那张截图。 |
| 成交动作 | 无。这类条的作用是把账号本身变成"AI 工具广告位",靠系列化积累人设。 |
| 金句 | 「我的员工越来越多了,但是分工明确」 |
| 可抄给 Mars | 拟人梗现成:「我雇了个记性最好的助理——全公司就它记得客户儿子几号中考」。5 秒、一张截图、一句梗,成本几乎为零,适合日更填充。 |
| 钩子原话 | 「赶快看看你的抖音是不是这样的黑色图标?你看看我的,已经变成白色图标了。那为什么你的抖音跟我的不一样呢?」——让观众低头去看自己的手机,软件类最强开场。 |
|---|---|
| 结构骨架 | 0-12s 图标对比钩:你的黑、我的白,制造"我落后了"的 FOMO 12-20s 揭晓:因为我用的是全新升级的 AI 抖音 APP 20-45s 场景一:首页搜索框问「常州的育儿补贴怎么领」,当前页面秒解答,双列图文+视频 45-58s 场景二:刷视频时想到新问题,视频下方就有搜索框,「什么空调最省电」 58-68s 场景三:难以启齿不好意思问别人的问题、路边花草拍照问 68-80s 免费大喊:完全免费、不用会员、无限使用次数和时长 → 「手机里的不求人神器,人手必备」 |
| 成交动作 | 下载引导,靠"完全免费+无限"推力。⚠️ 这类绝对化用语你们不能抄(见本报告风险纪律)。 |
| 金句 | 「手机里的不求人神器」(把功能翻译成一个身份标签) |
| 可抄给 Mars | ① 「你的 X 和我的 X 不一样」——让观众动手检查自己设备的钩子,是软件类视频里最有效的开场,可改成「你的 AI 还在每次重新认识你吗?我的已经不用了」;② 三个场景连演,每个都是具体问题(育儿补贴/空调省电)而不是抽象功能;③ 纯屏幕录制也能 3.5 万赞,Mars 的星图动画素材本身就够。 |
00:00赶快看看你的抖音是不是这样的黑色图标你看看我的已经变成白色图标了那为什么你的抖音跟我的不一样呢因为我用的是全新升级的AI抖音APP给你前所未有的一站式搜索体验边刷视频边解答问题让AI真正的为你服务
00:16首页下面就有搜索框打字语音都能问长洲的育儿补贴怎么领AI马上在当前页面给你秒机解答它给的答案又准确又详细不仅有文字下面还有相关的视频和图文它是这种双列的展现更加直观
00:32你看封面看标题就知道哪个是你想看的内容没有垃圾信息浪费你的时间你在看视频的时候又想到新问题了它视频下面就有搜索框你就可以直接问什么空调最省电AI立刻解决你心里的疑问在日常的生活里
00:48不管你有任何的问题都可以在AI抖音APP问它AI可以解答你所有的问题包括那些难以启齿的不好意思问别人的就算是路边的花花草草如果说你问了如果你不认识也可以用AI抖音下面这个拍照问问AI抖音APP真的太强大了
01:05而且就这么良心的一款软件它是完全免费的不用会员无限使用次数和时长让每一个普通人都能体验到AI给你带来的好处快速扫平知识盲区是手机里的不求人神器人手必备
| 钩子原话 | 无问句、无自我介绍,直接快剪报名:「豆包,聊天用的;DeepSeek,写文案的;Kimi,写长文的;Nano Banana,批图很牛的;Gamma,做 PPT 的……」 |
|---|---|
| 结构骨架 | 8 个工具 × 一句话定位(工具名+「……的」),20 秒卡点快剪;收尾「快用它们打造你的专属 AI 团队,更多 AI 技巧关注好好」。 |
| 成交动作 | 关注钩。收藏 20.1 万、转发 8.4 万,收藏是点赞的 1.45 倍——工具清单在抖音是被当收藏资产流通的。 |
| 金句 | 「打造你的专属 AI 团队」(把一堆工具打包成一个身份) |
| 可抄给 Mars | 重点不是抄这条,是想办法挤进这种清单:Mars 的一句话定位必须短到能塞进快剪——「Mars,记人的」。这句定位比任何长文案都该先定下来,它决定别人怎么替你转述。 |
00:00豆包 聊天用的 DeepSeq 写文案的 Kami 写长文的 NanoBunana 批图很牛的 Gamma 做PPT的 飞书 写会议纪要的 闪剪 做数字人的 吉梦 做海报的
00:15快用它们打造你的专属AI团队 更多AI技巧 关注好好
| 钩子原话 | 「为什么有些人做个不起眼的小工具,每个月能赚几千几万?这个网站把他们的作业本全摊开了」——疑问+一个具象比喻。 |
|---|---|
| 结构骨架 | 0-7s 疑问钩+「作业本全摊开」比喻 7-12s 亮数字:「收录了 2800 多个真实创收项目」 12-22s 你能看到什么(不是"它有什么功能"):月收入、用了什么工具、怎么增长、怎么切入需求、怎么找到第一批用户、创始人怎么起步、踩过什么坑 22-27s 行动指令:「先把这个入口留好,别上来就问什么赚米,先看看别人是怎么做的」 |
| 成交动作 | 收藏钩。收藏 2.3 万 > 点赞 1.9 万,「先把入口留好」这句就是明示收藏。 |
| 金句 | 「把他们的作业本全摊开了」 |
| 可抄给 Mars | ① 比喻式价值陈述:一句比喻胜过十条功能,Mars 版可以是「它把你这场直播的人情账本摊开给你看」;② 把功能表翻译成「你能看到什么」清单——不是"支持弹幕分析",而是"你能看到谁来过三次没说过话、谁问过价格没下单"。 |
00:00为什么有些人做个不起眼的小工具每个月能赚几千几万这个网站把他们的作业本全摊开了今天讲他收录了2800多个真实创收项目项目里能看到月收入用了什么工具 怎么增长比如你想做AI应用直接搜AI或SaaS就能看到别人做了什么产品
00:15怎么切入需求怎么找到第一批用户更实用的是连创始人怎么起步踩过什么坑怎么把项目跑起来也都写得清清楚楚想创业或者做副业先把这个入口留好别上来就问什么赚米先看看别人是怎么做的
| 钩子原话 | 「本系列视频时长共 180 分钟,包含 11 节课……特建议点个收藏再开始观看。你准备好了吗?」——第 8 秒就要收藏,第 93 秒再要一次,是全库把收藏钩压得最前、且重复的一条。 |
|---|---|
| 结构骨架 | 0-10s 说明书式开场:时长、节数、能学到什么、先收藏——不做情绪钩,直接交代交付物 11-30s 资历背书:「我是 Nenly,一个不会画画的设计师,将近 8 年创意行业经验;2023 年更新过一门 Stable Diffusion 免费公开课,到今天播放量累计超过 3000 万」 31-65s 正面迎击"过时"质疑:「都 2025 年了,我们还需要学习 Stable Diffusion 吗?我想了很久,答案依然是肯定的」+ 两个理由(真正完全免费、通过它才理解 AI 绘画原理) 65-95s 交付清单+二次收藏钩:总时长约 5 小时、合计 20 节;文生图/图生图/局部重绘/提示词/风格模型/扩展插件;「课程内容很干也很充实,我建议你先点个收藏再开始学习」 102-200s 第一课正片:从深度学习讲到 2022 年 AI 绘画元年(《太空歌剧院》获奖 + Stable Diffusion 开源发布)——先给历史再给操作,把工具讲成一个值得投入的领域 200s-10600s 十一节课正片:安装配置 → 界面 → 文生图 → 图生图 → 放大重绘 → 提示词 → 模型 → Lora;每节课末尾布置作业(「你或许也已经猜到这节课的作业了」) 10614-10654s 不收口,接连载:「恭喜你正式结束了这门课程第一阶段的学习……在马上开始的下一节课里,你将解锁扩展插件相关的功能」→ 「我们下期课见」 |
| 成交动作 | 全片零成交动作——搜遍 3 小时转写:「付费」0 次、「私信」0 次、「社群/星球/公众号/网盘」各 0 次、「完整版」0 次、「三连」0 次。只有收藏 2 次、关注 3 次。它把所有转化都押在"第一阶段/第二阶段"的连载结构上:看完的人自然去找下一节。 |
| 金句 | 「一个不会画画的设计师」(用短板建立亲近感)·「都 2025 年了,我们还需要学习它吗?我想了很久,答案依然是肯定的」·「播放量累计超过了 3000 万」 |
| 可抄给 Mars | 这是「免费给到极致」的天花板样本,但成本也是天花板(他自述重新录制剪辑花了 2 个月),你们不该照抄 3 小时。真正可抄的是四个动作:① 收藏钩压到第 8 秒并重复一次——长内容的收藏必须主动要,别等结尾;② 正面迎击最可能的质疑(他打的是「都 2025 年了还学这个?」,你们要打的是「AI 记性有什么用/我的数据安全吗」),别绕过去;③ 把内容切成阶段而不是合集,每节留作业+预告下一节,连载本身就是留存;④ 拿旧内容的累计数据当资历(3000 万播放)——你们的 vegaseek 复盘报告就是现成的"作品集"。 |
00:00本系列视频小时长共180分钟包含11节特写内容可以完整带领你了解AI绘画的有限位基础知识并入门StableDiffusion这个开源免费的AI绘画工具特建点的收藏再开始观看你准备好了吗嗨 这里是Nelly一个不会画画的设计师拥有将近8年的创业行业工作经验兴趣爱好之作一些理论学的为的教程
00:162023年我在我的频道上更新了一门StableDiffusion的AI绘画免费公开课到今天为止它的播放量累计超过了3000万可以更轻松地掌握这个神奇的工具
00:31如今AI绘画早就已经不是什么新鲜事物了各种在线的AI绘图工具网站和APP层出不穷门槛也变得越来越低好像人人都能用AI做出一些不错的图片来了很多人开始怀疑都2025年了我们还需要学习Stable Diffusion吗我想了很久答案依然是肯定的有两个关键的原因
00:46第一它是目前为数不多真正意义上完全免费的AI绘画工具只要你的电脑配置合格就可以随心所欲地生成图像不用担心额度就是通过它,我才理解了AI绘画的原理和工作逻辑
01:02并一步步学会了如何用它进行真正的创作所以,我想将这两年探索、学习Stable Diffusion得到的经验分享给屏幕前的你因此录制了这门总时尚约5个小时合计20节课程的Stable Diffusion零基础入门课它可以教会你如何使用这个工具实现纹生图、图生图、局部重绘等操作
01:17综合运用各种提示词、风格模型和辅助手段并安装一系列功能各异的拓展插件实现高质量的AI绘图作品产出在接下来约15分钟的时间里我们将系统地开启你的AI绘画第一课梳理一遍Stable Diffusion的发展历史 应用载体配置需求 安装方式软件界面和基本的操作步骤课程内容很干也很充实
01:33我建议你先点个收藏再开始学习你也可以顺带关注我一些比较热门热点的话题我会单独制作教程和大家讨论里面的操作方法和思路现在让我们开始今天的学习内容吧Stable Diffusion是从哪来的呢?现代意义上的AI诞生于2010年代以深度学习技术的出现作为标志
01:49这是一种模仿人类大脑神经网络结构通过大量数据学习并从中提取特征的技术能够让计算机自动识别、理解并生成复杂的信息这项技术深刻地改变了世界包括我们正在讨论的图像艺术创作领域早在2014年就有研究者通过训练AI实现了图片的生成
02:05但起初它所能实现的效果很粗糙只能生成一些简单的手写字符粗略的人脸与动物照片随着技术的刚叠AI所能生成的图片质量也越来越高且开始具备了一定的审美价值和创造力很多人会将AI生图技术称为AI绘画正是因为在这一阶段
02:20AI最擅长生成的便是像这样的绘画艺术作品2022年被普遍认为是AI绘画的元年在这一年的8月发生的两件标志性的事情见证了这些技术的重要突破和广泛普及一件是一幅使用AI创作的数字艺术作品《太空歌剧院》赢得了美国科罗拉多州博览会数字艺术竞赛的第一名
02:38引爆了公众讨论此时人们才惊讶地发现AI竟然已经拥有了媲美人类画家的手笔而另一件就是Stable Diffusion的开源发布在德国 一群来自慕尼黑大学的研究人员开发出了一项叫做浅空间扩散模型的新型图像生成架构后面他们带着这项研究
02:53加入了一家叫做Stability AI的英国公司在公司的支持下训练出了Stable Diffusion它通过算法迭代将AI绘画的精细度提上了一个新的台阶并能在一秒技术的时间内完成产出还可以在任何一台有民用机显卡的电脑上运行一经发布变成为了全世界最受欢迎的AI绘画模型之一
03:10在这门课里我们就将使用它来进行创作你可以在它的帮助下非常轻松地绘制出各种风格的作品比如东岸风插画立绘国风水墨3D建模甚至是照片级的拟真图像而借助注入Laura除去以上我所介绍的特点以外
03:28它受到欢迎还有一个非常重要的因素就是开源开源代表它的模型和源代码都是公开且可获取的和之前流行的各种只能通过在线服务访问的AI生图应用例如DAOE和Meet Journey有着天壤之别像我们开头介绍的一样只要你的电脑配置达到了门槛你都可以将它下载下来部署运行
03:44在本地实现不用排队无限量的图像生成而同样是因为开源有许多社区里的模型制作者乃至商业化的大公司全面化的大公司都对 StableDiffusion 进行了改进再训练运用出了基于它微调出来的各种演呈模型的技术也因此今天我们在讨论的 StableDiffusion
04:00已经不仅仅只是一个模型而是一个代表了开源生图模型体系的符号和象征那么去哪里下载 StableDiffusion 这个软件呢?和大部分生产能力工具不一样的一点是StableDiffusion 并不是一个真正意义上的软件最早他们公司开源的只是一个模型文件在那时如果想要利用它来生成图片
04:17必须通过一系列只有专业开发人员才会编写的代码来设置参数并运行但后来有一位叫做Automatic的开发者将这些代码做成了一个基于浏览器网页去运行的图形界面极大地方便了广大的用户使用它的过程这个程序就是广受欢迎的StableDiffusion Web UI
04:33简称SD Web UI了它将模型的各项参数调节转化成了非常直观的选项数值与花块集成了绝大多数StableDiffusion模型可以实现的功能比如文生图、图生图、局部重绘、放大修复等还兼备了一部分模型训练、图像处理和原数据编辑的功能
04:49它同样是开源且免费的而得益于开源社区的贡献很多开发者将一些其他的AI模型或先进技术制作成了它的扩展插件从而让它可以进一步拓展出许多强大且实用的功能有开发和编程基础的朋友可以按照StableDiffusion Web UI项目仓库里提供的这一套安装流程
05:05通过GitCon 拉取项目并自动完成所有配置但我猜大部分正在收看这门课程的你可能对这些东西并不是这么熟悉为了方便你进行接下来的学习我按照课程教学内容为你量身定制了一个学习版的SD Web UI程序你可以在我们这门课的配套教学辅导书里找到下载方式
05:21我会推荐你在它身上开始这门课的探索和学习随着课程推进你会慢慢学会如何为它下载更多的模型安装各种扩展插件从而实现更高程度的自定义配置将它下载到你的电脑上以后应该会是一个长这样的压缩包这个时候你需要先在电脑上安装一个
05:36诸如7-Zip、Band-Zip这样的解压缩工具然后就可以右键点击它把里面的内容解压出来随后双击里面这个名字为启动的.bat文件就会弹出一个这样的小黑框它是电脑的命令行里面运行的就是你StableDiffusion Web UI的后台等待加载完毕以后
05:52你的浏览器会自动打开在里面呈现出StableDiffusion的操作界面了在运行的过程中你需要保持这个命令行后台开启在你碰到一些报错的时候在里面也会出现一些提示信息会是你解决报错的线索如果你不小心关闭了浏览器的操作界面那也只需要在命令行里
06:08重新找到这个本地端口地址输入到你的浏览器里就可以再次打开等到你使用完毕了需要退出的时候再把这两个窗口一起关闭就可以了不过和任何一个生产力工具一样SD-Wave UI也是有一定的配置要求的首先它需要一张性能足够强大的独立显卡
06:23提供算力进行绘制你可以在电脑设备管理器的显示适配器一栏中查看自己的电脑是否拥有独立显卡以及它的品牌、型号虽然理论上任何一个品牌的显卡都能提供它需要的算力但根据大部分使用者的经验英伟达,也就是我们上述的N卡
06:38在AI计算方面的表现是最为出色且稳定的其次,它还要求你的电脑有比较充裕的显存如果你的显卡是N卡那可以打开电脑的命令提示符功能输入NVIDIA SMI在这一栏里查询到你的显卡显存水平你的是多少呢?在 SD-Wave UI 中
06:54运行不同绘图模型对显存水平的要求是不一样的对于最基础的 Stable Diffusion 1.5 模型而言一般需要至少 4GB 的显存来支持模型运行而运行注入 SDXL 一类的比较新且规模更大的绘图模型要求会更高对于学习这本课程的你来说
07:10我会建议你在至少拥有 8GB 显存的情况下再考虑在本地安装 Stable Diffusion对于硬盘、内存等项目Stable Diffusion 并没有强制性的要求但也不能太掉队这是我根据使用经验总结出来的一套推荐配置与最低配置如果你的电脑至少达到了
07:25这个表格里所展示的最低配置线那就可以把它下载到你的电脑上驱动StepDiffusion模型生成图片啦当然即便你的显卡信号不符合要求或是显存水平达不到门槛不意味着你没法使用WebUI但可能只能使用速度较慢的CPU来运算绘制一张图片可能要花上几十分钟的时间
07:42而在绘制的最高分辨率可以使用的功能上都会有所限制整体体验会比较差这种情况下,我不推荐你强行在本地使用它来运行不过,现在有许多可以在线部署SD Web UI的云服务器平台是你可以选择来学习的这些云服务器会提供算力充足的显卡
07:58供我们在线上运行模型我们今天不做展开叙述但如果你需要这方面的专门指引就不妨在弹幕交个二来预定一期专门的教程吧无论你是通过什么设备哪种方式使用StableDiffusion Web UI的在你顺利启动程序以后应该都会进入这样一个浏览器窗口
08:14它就是SD Web UI的主要操作界面啦你想知道这个界面里的各个部分都承载着什么样的功能吗让我带你来转一圈吧在Web UI的上方有一排可以灵活切换的标签点击它们可以在Web UI中的各种不同功能板块里灵活切换
08:29开头的这两个分别主管着Stable Diffusion模型的两项核心功能纹生图以及图生图我们会在接下来的第三课第五课中分别展开分析第三个标签更多用于承载和图片编辑处理有关的一系列功能例如裁切放大
08:44我们会在这个系列的第七课里做进一步的探索第四个标签图片信息则是用来读取生成图片参数的在第四课里我们会讲解它的使用方式后面两个会和模型的训练合并有关我们说不定在模型训练的相关课程里有机会用到而倒数第二个设置
09:00装着它所有与软件相关的设置项目有点类似于PS等软件里的首选项界面就这样干讲可能过不了多久你就要开始打瞌睡了那不如我们来动手生成一张图片吧我们回到第一个文生图标签里顾名思义文生图就是向AI提供一串文字描述
09:17让AI根据这些描述来生成一张图片这些文字描述便被我们称为提示词而输入提示词的地方在最上面的这个大文门框里你可以在脑海里勾勒一个你想要描绘的画面比如一个站在海边的女孩夕阳照亮了她身体的轮廓
09:32啊对了Stable Diffusion模型是不认识中文的所以你需要用英文来描述你脑海里的画面当然即便你不那么深浅英文也可以借助一些翻译网站把你的描述转换成他认识的语言随后你可以借助下面的一系列参数选项对图片生成的细节做一些调整
09:48这里面的大部分细节我们会在第四课里仔细梳理但有一些选项的作用还是非常显而易见的比如宽度和高度决定的就是生成图片的尺寸比例这里我想要生成的是一幅横平16比9的图片那我们可以稍微调整一下把它的宽度设置成910来适应这个比例
10:05其他的选项你都可以暂时维持默认不变点击一下右上角这个醒目的生成按钮很快SD模型就会为你开始工作啦看,只需要不到几秒的时间一张符合提示词描述的图片就出现在了右侧的这个预览窗口里这就是你用Stable Division生成的第一张图片啦
10:22它是一张真实世界风格的照片那如果我想让它生成一幅更富有艺术感的绘画作品呢有两种方法能让Stable Division帮你实现第一种是修改我们的提示词你可以在原来的提示词前面加入这样一句话一幅文森特梵高的画作
10:38再点生成看画面是不是立刻就带有梵高式的有画风格质感了呢第二种则是修改我们的模型在页面的最上方有一个标注着Stable Diffusion模型的选项我们默认选中的这个模型是Stable Diffusion 1.5版本的官方模型它生成出来的图片多半是偏真实照片风格的
10:56点这里你可以展开一个包含你所有模型的选单在它的下面有另一个叫做Anilora Animamix的模型它是一个基于SD1.5模型微调并融合出来的二次元动漫风格的模型每一个不同的模型可能都会带有一种完全不同的绘制风格我们会在马上开始的下一课里讨论更多和模型类目有关的知识
11:14到那时我也会向你系统介绍一些获取模型的渠道你就可以去自由下载你喜欢的模型了点一下它等待加载完毕就可以把web ui里的生成模型切换成它此时我们再点一下生成看生成的图片就带上了一层日漫风格的质感了
11:30不过它生成的日漫似乎有点太粗糙了是不是这个模型的质量不行当然不是了不同模型的使用方式其实可能还有点不太一样像这个模型就比刚刚那个官方模型用起来要稍微复杂一些具体来说在写提示词的这一环里
11:45除了描述我们想要画的内容以外我们还得加入一些神奇的咒语来确保模型能更充分地施展自己的能力你可以在我们的辅导书里找到这两段对应的咒语把它们复制一下然后分别粘贴到上面的描述下面以及下方的这个反向提示字框里
12:00你应该还挺好奇这里面这些奇奇怪怪的单词数字都是代表什么意思的它们其实是我们和AI沟通的一种比较特殊的方式不用着急第三课里我们就会详细聊聊啦再点一下生成看效果立竿见影这幅日漫是不是比刚刚要精致细腻多了呢
12:17你对这幅作品的效果满意吗它整体还是非常富有意境的也把我们想要表达的东西都给体现的差不多了就是这个女孩似乎人在画面里小了点没关系无论这幅画有什么让你不满意的地方你都可以随时调整你的要求让AI给你再画一幅出来
12:33那假设我们想要这个人离画面更近一点呢请在刚刚那句描述的后面敲一个小逗号然后输入两个英文单词一个是Upper Body代表上半身另一个则是Close Up代表近距离的特写再点生成看,他就把人物拉到近景来了
12:48但人物的眼神好像有点飘忽我们可以让他看向镜头吗?当然可以输入Looking at Viewer即看向观众生成一下子就搞定了不过嘛这幅画面好像还可以再富有宜静一点让我来告诉你几个小操作首先我们可以通过赋予画面景深感
13:05让人物相较于背景更加突出输入depth of field和bokeh点击生成看感觉是不是又不太一样了呢但此时如果你放大图片会发现除了人物主体以外背景还是有些粗糙和模糊的这大概是因为我们生成的图片分辨率还是有点太低了
13:21不过不用担心此时我们可以把参数里的这个高分辨率修复的选项给勾选上並將重回幅度適當降低到 0.6它會給你的圖片做一次徹頭徹尾的升級具體的一些使用細節我們在後面的第六課裡會有一次非常深入的分析
13:36與此同時我們可以給這張圖片再加點料一個我很喜歡的用於增強畫面氛圍感的資助是 Cinematic Lighting用在這個場景裡還挺合適的另外因為背景裡有一道來自於西洋的強光照所以我們可以給它再加上一個Lens Flare 鏡頭光暈來塑造那種唯美而清新的感覺
13:53做好這一切以後點擊生成这次应该会稍慢一些如果卡住了你也可以试着降低一下高分辨率修复里的放大倍率看 一张非常精美细致的AI绘画作品就诞生了希望这个小小的案例可以帮助你充分体会到Stable Diffusion的奇妙之处
14:09WebUI的功能特点以及AI绘画这项技术的乐趣所在在接下来的更多探索的时间里你可能会和我一样慢慢感受到人工智能的智慧以及它可以给艺术创作视觉传达带来的深刻影响而今天我们展示的只是这里面最最基础的
14:25在完成了接下来一系列课程的学习以后你甚至还可以通过模型提示词和更多进阶的手段精确控制人物的发色服饰姿势整理的构图和风格并且基于图片做各种富有创意的延展今天就先做到这里吧坏了我们刚刚生成了那么多图片
14:42它们都没有保存下来怎么办别担心在WebUI里绘制完了一张图片以后你不需要去对图片进行特别的保存因为所有生成的图片都会在你的本地文件夹里保存一份我们在WebUI的根目录也就是刚才解压出来放置的那个文件夹里依次打开这几个文件夹
14:58就可以找到生成图片的保存地址了这个Outputs文件夹装着所有你生成过的图片Text to Image代表文生图Image to Image代表图生图点开它所有你在对应功能下生成的图片会被按你生成的日期分好文件夹摆放此外在你生成完了一张图片以后
15:14你可以通过预览窗口右上角的这个下载按钮把它快速保存到你浏览器的下载文件夹里同时点击下面的文件夹按钮你也可以快速打开它所在的文件夹如果你觉得这样浏览起来麻烦那其实还有一种更简单的方式可以读取你生成过的图片
15:29但它需要你额外做一点小操作我们来到界面上方最后一个标签扩展里在这里你可以为你的Web UI安装各种功能强大的扩展插件点击可用再点击加载你就可以看到所有Web UI可以安装的扩展插件
15:45在下方输入英文Image Browser进行搜索可以找到一个叫做图库浏览器的插件点最右侧的安装等一小会儿你就可以看到上面跳出安装成功的提示了回到已安装点这个醒目的应用并重启按钮同样等待你的WebUI重新加载完毕
16:00在最上面就会多出一个图库浏览器的标签点开它按一下首页进行刷新你就可以按照时间顺序看到所有你生成过的作品了如果你也成功做到了这一步那恭喜你你也顺带掌握了在WebUI里安装扩展插件的基本方式了
16:15图库浏览器还有很多进阶的用途比如例如它完整记录了你图像里的各种生成信息你还可以利用它快速打开一张已经画好的图像并且对它做图生图、局部重绘等等编辑操作我们会在第八课里针对这些功能讨论更多而你也肯定开始好奇
16:32还能通过安装插件这种方式给自己的Web UI去附加哪些强大的功能了正好,后面的第十二课和整个第二阶段的所有内容就是用来分享这些的以上就是本期视频的所有教学内容啦来做一个总结在今天这一节课里简单了解了AI图像技术的发展历程
16:48介绍了Stable Diffusion模型的来历以及SDWebUI这个用来驱动SD模型的应用随后我们对SDWebUI的基本操作界面进行了简单的介绍并尝试在里面指挥AI上成了一幅简单的风景人物插画还熟悉了保存浏览图片以及安装插件的基本方式
17:04学完以后你还会觉得SD难用吗对它的定位和使用方式有更加清晰一点吗欢迎你在课程的评论区留下这节课的学习心得当然如果你想检验一下自己到底有没有学会这节课也为你布置了一个小作业请跟随着我们课程的步伐完成SDWebUI的初步安装与配置
17:21并且使用与课上我所示范的类似方式画出你的第一张图来图片的内容不限最好有人物与风景如果这节课里的内容你都消化到位了那我相信这个作业不用花费你很长的时间最多五分钟你就可以搞定了顺便我们也来约定一下在之后的课程里提交作业的方式吧
17:37你可以把你做出来的图片通过带图评论的方式回复在这个视频的下方如果你愿意也可以在评论里附上你使用的提示词或是生成创作的思路等等我会在更新这个视频的同时抽出一些时间给你批改这些作业希望这个新手教程可以帮助你迈进AI图像生成领域的大门
17:54并认识StableDivision和WebUI这对老朋友在他们里面还蕴藏着非常多值得你探索的新知识马上在下一节课里我们就将梳理一下和模型这个StableDivision生图的核心有关的一系列知识和基本概念啦我会在里面和你详细地讨论在SD-Wave UI中使用的
18:10模型分类 版本区别 文件构成与搜寻筛选下载模型的一整套流程方法并带你体会如何借助风格多样的模型塑造生成作品的不同风格感谢您的收听这里是Nanling我们下期课见啦拜拜先弄清楚一个非常基础的问题
18:36模型是什么嗨 这里是Nelly你现在正在收看的是我们的Stable Diffusion Web UI零基础入门课的第二课在上节课里我们其实已经提到了Stable Diffusion不单只是一个模型经过了两年多的发展到了今天它已经演变成了一种AI绘画的架构和体系顺便上流传着各种不同版本
18:53形式的SD模型它们的风格和效果不尽相同使用的方法也有很大区别总是容易让初学的朋友陷入迷茫我该使用哪个模型它们之间到底有什么区别所以我打算专门用一节课的时间来和你好好聊一聊和模型有关的那些事帮你理出这个庞大模型生态的根系和脉络
19:09了解针对功能、版本代际、产出图片风格对模型做分类的方式教会你如何搜集、筛选合适的Cyber Division模型并带你亲手体验一下不同模型之间的差异找回它们一定会让你接下来的所有学习探索变得事半功倍准备好让我们开始今天这节课的学习内容吧
19:24模型到底是个什么东西在上节课里我们提到过AI是通过一种叫做深度学习的方式学会生成图片的而它的学习资料便是人类互联网上的海量图片包括各种风景、人物、物品的照片以及各类风格流派的艺术作品研究人员会根据画面内容
19:40给每张图片添加一些文字描述而AI会试图理解这些描述和图片里包含的各种形象、元素乃至画面风格之间的关联而通过学习以后积累下来的知识会被打包成一个文件它就是我们一直在提到的模型而我们也通常把这个未养图片让AI学习
19:56以建立一个富含知识的模型的过程叫做模型的训练不过模型里存储的并不是这些用于训练的原始图片而是从它们身上提炼出来的一些规律这些规律会反映在成百上千个参数的变化上面而模型所记录的正是这些参数变化
20:11和我们输入的文字指令之间的对应关系所以当我们向AI输入文字指令时模型就会根据指令调用对应的规律从而推理出一个相应的形象又或者是将不同的规律做排列组合从而创造出一些以前不存在于这个世界上的新东西
20:27这就是AI生图模型强大的能力与丰富的想象力的根源在很多其他AI生图的应用里模型其实并不需要使用者操心例如MeJourney绝大部分使用者都只会使用最新版本的官方模型出图作画因为这个官方模型的能力非常强生成出来的效果也非常不错
20:43Stable Diffusion也发布了很多个版本的官方模型我们上节目使用过的1.5版本就是他们最早开源出来的一批生图模型然而现在大家都不怎么用它来生成图片了因为在今天看来它的表现实在是有点不尽人意了不过因为它是开源的
20:59有许多开源社区里的开发者包括一些商业化的公司和团队都摸索出了去改进这个模型的方式他们会给模型提供一些额外的图片去让AI进行补充学习从而让它掌握一些一开始并不具备的新知识我们把这个过程叫做对模型的微调
21:14经过了微调训练的模型就是微调模型而为它们提供了微调基础的这个官方模型一般就被称为基底模型简称底模微调这一行为其实广泛地存在于各种AAM模型的训练应用里它的主要目的就是让模型可以更好地适应
21:29某一个特定细分领域的任务在生图领域也是如此比如我们用过的AAM模型就可以看作是在SD1.5模型的基础上加入了更多二次元风格的作品进行了微调的成果因此它会比原版的SD1.5模型更擅长绘制二次元风格的画面伴随着源源不断的额外学习
21:46底膜的能力也会在这个过程里不断被增强如果你使用的是目前最流行的一系列微调模型你会发现它们在同等的分辨率选评上能实现的画面精度会显著高于这些基础模型因此去运用各种不同风格的微调模型来实现更加精致且风格化程度更高的绘制效果
22:02是Stable Diffusion的运用里不可或缺的一环现在你算是知道市面上这么多SD的模型都是怎么来的了吧为了区分不同模型之间的差异我们常常会按照一定的标准对模型进行分门别类首先是模型的功能类型这些可以用来出图作画的模型
22:18在业内人士那里有一个更专业一点的称呼叫做检查点因为训练模型是一个漫长的需要持续很久的过程当训练进行到某个关键位置的时候就会建立一个检查点来保存当前的参数状态和训练进度方便日后恢复或继续训练
22:34就好像我们在游戏里每隔一段时间需要存档一样万一后面的boss打不过了就从这里再开始挑战这就是CheckPoint的来历这个保存出来的检查点就可以用来支持我们的WebUI生成图片在StableDiffusion的世界里大家就逐渐把它作为生图模型的代名词了
22:50有时候我们也把它叫做WebUI里的大模型因为它在生图过程中起到最主要的作用其次它的文件也很大可能有2到7个GB左右除了CheckPoint以外WebUI里还有一些起到辅助作用的小模型例如同样对基础模型起到微调作用的Embedding LoRa等
23:06或者是用于放大修复的GAM雷模型它们往往需要和Checkpoint搭配在一起使用无法单独发挥作用也因此我们会基于这一点将它们做区分但它们同样也非常重要在第六第九课里我们会再展开讨论到那时你会见识到它们的升级作用的
23:22其次是模型的版本在提到一个模型的版本时我们往往指代的是它的基础模型版本在过去的两年间Stable Diffusion陆续推出了很多个不同的模型版本在1.5之后又发布了2.0 2.1 XL 3.0 3.5等等
23:38它们都可以作为微调的底模大家也常常用这些版本号来代指所有基于这一个版本的底模微调出来的一代模型在微调里底模的能力强弱会直接地影响到微调模型的质量理论上更新进推出的模型往往会拥有更先进的架构
23:54更大的参数量也会经过了更为深入的训练在综合能力上就越强这个能力可以体现在很多个方面比如语意理解能力细节质量或真实度分辨率等等等等或者直白点说能力越强的底膜直接生成出来的图片就会越好看
24:09像这是同一组提示词在SD1.5Excel和3.5版本上分别生成出来的效果你可以很清晰地看到其中的差异底膜的能力越强去改良的压力就越小改良完的上限肯定也越高那照这么说我们无脑选最新的模型
24:25用就好了吗然而因为训练使用的参数量变得更大了它的配置需求和使用门槛往往也会显著提高比如最新推出的SD3.5版本模型就至少得以需要有16G显存以上的中高端显卡才能顺利运行而想要基于它做微调配置的门槛就更高了
24:42所以越是新版本的模型衍生出来的微调模型往往就越少作为使用者我们在这些版本上的选择肯定就越少了不光是微调模型不同代底模间的配套设施包括我们后面会接触的CountryNet IP Adapter等等往往也是不同用的这就会导致我们有些依赖特定工具实现的操作
24:59基本只能在特定版本里实现总的来说新版本模型的生态往往不如老版本来得这么健全像这三个版本里SD 1.5的生态系统反而是相对最完善的依赖微调程度高的模型和一些配套的工具有时生成的质量
25:15会比新版本的模型来得更加让人满意也可以实现可控程度更高且效果更稳定的生成而因为它的配置要求最低至今应该仍然是用户基数最大的一代模型而Excel模型在刚推出的时间节点曾经也因为类似的原因不太受欢迎
25:30但经过了非常长时间的开发现在的配套生态已经相对趋于完善而它的底膜素质相较于1.5确实存在明显优势所以有些微调出来的模型效果也更好开始逐渐成为了很多用户的优先选择而除了SD公司其他公司也开源了一些可供微调的底膜
25:48比如非常受欢迎的Flux混元等而当基于某一个版本的微调进化到了一定阶段以后可能又会孕育出一些新的底膜比如Pony, Illustrious等等等等听了这么多,头都要大了吧不过在这个阶段我觉得你可以不用太过于纠结版本的选择
26:04为了尽可能方便地让屏幕前的你顺利开展学习同时本着带领大家全面地了解SD功能体系里的所有内容的出发点这个系列的课程会以普及程度最高的1.5版本的模型作为操作演示的主体我也会推荐你先从1.5版本上手进行探索
26:20根据我自己的经验当你在1.5版本的生态里把各种有机会使用到的功能都摸清楚了将基本功打扎实那进入新版本以后一定可以很快找到对应的方向并根据版本的差异做出调整而在这门课程的第三部分我预留了充足的篇幅
26:35来和你单独讨论这里面每一个版本的适用要领到那时你一定是可以快速适应每一个新版本的基于制作方式我们也可以将市面上的模型大致归为两类要想得到一个可以用来生成图片的checkpoint目前一般有两种比较主流的制作方法
26:50一是靠直接的微调训练就是像我们刚刚所描述的加入新的图片让AI补充学习另一种方式则是靠融合因为Checkpoint内部存储的本质上是一些数据和参数有许多模型创作者就会把几个不同的模型融合到一起让他们的参数以一定的比例混合起来
27:08从而创造出一个不同于他们的新模型通过这两种不同方法得到的Checkpoint就分别被我们叫做训练模型和融合模型理论上融合模型的制作比训练来得更简单但他们之间的关系无法用数优势列来评价在他们两大类中都诞生了许多优秀的模型
27:25在使用层面它们在你面前发挥作用的方式也没有什么太大的差异但对于模型训练者来说它们是两种用来创造新模型的手段如果你感兴趣那在日后关于模型微调训练部分的学习里会有机会进一步接触到这些标准是基于模型身上的一些客观属性
27:41来进行分类的但我们在实际使用的过程中更关注的是模型身上所具有的风格特点基于广大用户对风格的普遍认知和实际运用的场景区别市面上的Checkpoint可以大致地被划分成如下三类一种是偏真实系的大多使用真实照片训练
27:56致力还原真实世界的特点一种是偏绘画插画风格的具有比较鲜明的绘画笔触制感用于创造各种富有吸引力的艺术风格为了方便叙述我们统称为二次元系的模型鉴于这两者之间的还有一类生成效果接近于一些影视、游戏里的CG
28:12或是建模软件里能制作出的三维渲染图不如二次元的那么平也不如真实的那么真我们把这类模型的风格叫做2.5D的你可以根据你的需求来应用不同风格的模型实现对应的生成效果比如当我们的目的是生成一些服装的电商宣传图
28:28或室内设计的效果图时一般就会选择真实系的模型如果要做一些富有科幻感的场景或产品设计用2.5D类的模型一般会取得不错的效果而做游戏美术和角色设计的情况下就会更多的和二次元系的模型打交道当然这些所谓的风格之间
28:44其实并不存在一个绝对的界限一些风格泛化能力比较强的模型在不同的提示词下是有可能被激活不同的风格表现的而随着学习的推进你会发现同一个大模型在不同的Lora Embeddings的作用下也有可能生成不同风格的图片但绝大部分的模型都是树叶有专攻的
29:02所以你可以把这种所谓的风格大类看成是我们基于模型主要用途做的一种粗略归纳方便在不同的需求场景里对号入座而进一步去理解每一个模型其实都有自己独一无二的一种风格随着你用的模型越来越多你对这一点的认识
29:18一定也会越发深刻了解这些分别类的标准相信你对Stable Diffusion中的模型会建立起一个更加全面的认知不过此刻你的Web UI里可能还是只有上节课里我们用过的那两个模型我们要上哪里去找到更多不同风格和效果的模型呢
29:33最早基于Stable Diffusion微调模型的工作主要是一些有专业知识背景的人在进行他们会将模型分享到一个叫做Hugging Face爆爆脸的网站上面它是目前全球规模最大的机器学习模型与数据集的共享网站所涉及的内容不仅包括AI图像模型
29:49还有很多其他AI领域里的东西在最上方的标签栏里点Models就可以进入它的模型共享专区而在左边的筛选栏里点亮Text to Image的标签你就能筛选出那些主要被用于AI生图的文生图模型了在右上角的排序按钮这里你可以选择按照趋势
30:05最高下载量或最多点赞量对模型进行排序如果你听说了一些在市面上流传的非常好用的模型那都可以来这里搜搜看而伴随着个人模型训练的技术普及市面上出现了许多专门分享图像模型的门户网站和社区平台其中在全世界范围内
30:21历史最为悠久影响力也最大的一个平台叫做Civita俗称C站相比起Hugging Face它的界面要更加直观又能精准呈现模型特色的封面点进来以后还能看到模型的一系列样例图作者专写的使用说明和其他社区用户使用这个模型生成的内容
30:37在它上面搜寻模型的方式和Hangin Face类似点击上面的Models就可以进入模型分区使用排序按钮你可以很轻松地找到历史上最受欢迎或者最多下载量的那部分模型它还有一个专门的筛选器通过它你就可以按照我们刚刚提到的这几点标准
30:53来筛选出合适的模型同时模型的左上角也会显示它的功能类型和底膜版本非常直观清晰如果你想按照刚刚我们提到的几个风格大类筛选出对应类别的模型还可以借助我下面列出的一系列关键词进行搜索一般都能找到符合你需要的模型
31:09在同类型的网站里Hugging Face和Civitie算是模式最具有代表性的两个而除了它们以外还有很多类似的网站例如ModelStop,LibLibAI等都提供了类似的模型分享和下载的平台在我们的课程资料里我为你完整总结了一份可以搜集模型并下载的网站清单
31:25同时我为你总结了一些各个风格大力下广受欢迎,下载量和评价都比较不错的模型一共6个它们基本可以覆盖你学习过程中对各种不同风格图片的绘制需求你可以把它们作为你开始正本课程学习的模型新手包要成为一个成熟的StableDiffusion使用者
31:41首先应该掌握的就是自己搜寻下载模型的能力让我带你来实操一遍这个流程吧先从这个Realistic Vision模型开始它在Hugging Face和Civitize上都可以找到我们先来到Hugging Face你可以通过最上方的搜索框直接输入模型的名字来进行查找
31:56找到以后点一下名字就可以进入模型的页面了点进去以后首先摆在你面前的是一个model card模型卡片相当于是这个模型的介绍页面作者往往会在这里交代一些和模型相关的信息或是使用时需要注意的事项如果想下载这个模型
32:12你需要切换到第二个文件标签里制作者们会把文件、源代码等按照模型结构放在不同的文件夹里一般来说你在最外层的文件夹这里都可以找到一个save tensor格式的checkpoint文件点一下旁边的小箭头就可以把它下载到你的电脑上了
32:27而在savetite上你也可以用类似的方式进行搜索当然如果你有按照下载量对模型排序那不用搜了它应该就在最前面点开它的模型主页在最简单的情况下你只需要点击一下右边这个非常醒目的下载按钮就可以把它下载到你的电脑上了
32:42而安装的方式也非常简单下载下来以后你可以选中这个模型把它复制或者剪接到SD Web UI的模型文件夹里就是给Modus下的这个Stable Diffusion文件夹看我们上次课里用到的两个模型都在这里了此时再启动Web UI
32:58左上角的模型选单里啦如果你是在WebUI打开的状态下添加了新的模型那需要先点一下右边这个刷新按钮这样新的模型才能被显示进来这样就算下载完一个模型了吧用类似的方式你可以找到刚才所列举的所有模型即便没有找到也不用担心
33:13在课程资料中我把这些模型的原始下载地址都完成记录了一份点击也可以直达这些模型的下载页面不过在你刚刚点进模型页时肯定也注意到了我们好像有很多不同的下载选项有叫不同名字的带着不同数字编号的甚至是不同大小的
33:29很多数学者总是会被里面这些五花八门的选项困住感到有些无从下手它们分别都代表着什么呢别担心让我来为你梳理一下首先上面的这一排标签代表的是这个微条模型的版本就和底膜会不断迭代更新一样
33:44微条模型的作者也会有动力对自己的模型进行不断的训练和改良而每发布一个新的版本时在上面就会出现一个新的标签一般来说新版本的模型相较旧版本总是会有所改进的所以我们一般只需要选取最新的那个版本号并下载就可以了
33:59当然你也可以通过每个版本展示出来的这些预览图看看哪一个版本呈现的效果是你最喜欢的你可能会注意到这些版本号的后面有时候会跟着一些奇奇怪怪的描述其中出现最多的就是个VAE了VAE也是一种在生图过程中
34:14会发挥作用的AI模型它的全称叫做变分自动编码器在生成的过程中主要任务就是编码负责将图片编码成把空间数据或者去造后的空间数据转化为正常的图像那它对生成会有什么影响呢?如果你下载了Counterfeit这个模型
34:30直接使用它在你的Web UI里绘制一张图片你会发现图片的有些细节可能会变得非常模糊失真甚至出现这样的一些高饱和度的色块而另一些模型在生成的过程中预览看到的图片是清晰饱满的但一旦生成完毕就变灰了
34:45这些情形通常就是正在使用的VAE和大模型不匹配导致编码的过程出了一些问题从而损害了图片的质量为了避免这种情况出现大部分模型会选择将一个合适的VAE整合到自己的大模型里你刚刚看到的这些所有标有VAE的版本
35:01代表的就是这些版本的模型整合了合适的VAE而脸眼线模型的制作者则会推荐一个合适的VAE来搭配使用比如Mainamix就同时提供了VAE的下载链接将它下载下来装着VAE的文件夹也在Models里然后我们只需要在使用模型的时候
35:16同时调出对应的VAE来进行编码等一下,在哪里调整VAE呢?这个入口有点隐蔽在设置的VAE选项里和大模型一样,点一下刷新就可以看到刚刚我们置入进来的VAE了选好VAE以后,点一下上面的保存设置就可以顺利换上这个VAE了
35:32顺带教你一个小操作如果你觉得每次这样调整麻烦那可以切换到旁边的用户界面一栏里找到这个快捷设置列表将SDVAE的选项输入进来然后同样保存设置并点一下旁边的重启UI按钮重新启动你的WebUI
35:47重启后,你会发现这边最上方的Checkpoint列表边上多出了一个一模一样的VAE选单后续,你就可以像切换大模型一样在这里很方便地切换VAE了换上了合适的VAE以后生成图片就不会出现刚才那样的问题了而如果你的模型自带有VAE
36:03那一般选择自动就可以调用模型默认的VAE进行编解码操作另一个比较常见的标志则是Inpainting它代表着这个模型是专门用于重绘操作的你将会在接下来的第八课里使用到这类模型到那时你也会理解它的意义所在了在刚才我们下载VAE的这个位置
36:20有些模型会提供多个大小不同的版本它们有些可能一个多G有些三到四G甚至更大那这种时候我们要下载哪个模型呢这些模型之间的差异主要集中在模型的量化精度和是否进行了减脂等操作上面量化是一种以损失少量精度为前提
36:36对模型进行压缩的手段而减脂则是另一种通过将模型里不那么重要的部分删除掉来提高效率并节约空间的方式理论上它们都会和原版模型有一定的差异但反映到伤成效果上时是很难被肉眼识别出来的在现阶段如果你只会将它们用于生图
36:52并且只想简单地知道该怎么做选择那选你能看到的那个最小的checkpoint一般而言都是性价比最高的选择了解了这些相信你就不会再被模型的下载所困扰了当你把这些所有的模型都下载了一份并且在你的StableDivision文件夹里放着了的时候
37:08那你就可以在WebUI里体验一下用它们出图的感觉啦此时刷新一下左上角的选单打开你已经可以看到所有放进来的模型了不过除了在这里Web UI里还有另一个可以用来切换模型的选单在这里没错点一下这个小标签就会展开一个更大更直观的模型选单
37:26所有Checkpoint模型会以卡片的形式呈现在界面里点一下对应的模型就可以完成切换再点生成参数就可以回到调节参数的界面我们使用和上一节课一样的提示词在Realistic Vision里生成一张图片看看先别急着回去翻视频看提示词其实不用那么麻烦
37:42在图库浏览器里找到你之前生成的图片点开以后在右侧的最下方你可以看到一系列按钮它可以将你这张图片的生成参数快速地发送到其他的功能板块里点一下文生图看 所有的提示词和参数就被同步过去了点击生成
37:57你就会得到一张在海边看夕阳落日的人物照片再换成其他模型呢这次试试Rev Animated人物是不是立刻就带有一种3D模型的质感了呢你可以再试试ManaMix或者Counterfeit不能看到即便同样都是偏绘画风格的模型但呈现同一画面的方式
38:13细节表现的形式都是完全不同的你会更喜欢哪个模型的效果呢当然就和我们上节课里讨论的一样不同模型的使用方法其实可能也会有一点差异想要发挥模型的全部实力还得花点时间去琢磨它们的使用方式而这会是我们在接下来的几节课里
38:30一点点去讨论的从现在开始就让这几个模型陪伴你度过这段新手上路的阶段吧在来回切换模型的过程中我们是靠每个卡片上的名字来辨认模型并且去做选择的但当模型多起来了以后想要第一时间记起每个模型的特点风格好像也变得有点困难了
38:46正好我有一张能帮你非常轻松地解决这个问题我们先把生成的尺寸设置为512x768这样你可以得到一张竖板2比3比例的图片随后还是像上节课一样将高清修复打开生成一张清晰而富有意境的图片
39:02OK现在打开刚刚的模型菜单找到你正在使用的这个模型当鼠标放在它的卡片上时右上角会出现两个小按钮点这个像是设置一样的按钮会打开这个模型的信息配置界面看你可以在这里面给每个模型进行一些备注笔记
39:17甚至是预先选好它搭配的VAE模型这样每次你不需要专门在VAE选单里给它找匹配的VAE只需要切换成这个自动就可以自动加载这里面选好的VAE了此时我们点击一下最下面的替换当前预览看你刚刚生成出来的这张图片
39:32就变成这个模型卡片上的封面了点保存退出来这下你还会有模型选择困难症吗?以上就是本期视频的所有教学内容了在今天这一节课里我们从头了解了CableDiffusion的模型世界梳理了不同风格的模型之间的差异微调模型的基本概念
39:48以及模型的获取下载渠道以Hugging Face和CBite两个网站为例着重分析了在这些网站上搜寻筛选模型的方式并熟悉了包括版本、功能类型在内的各种模型的分类标准同时我们也接触了一些在各个风格类目下最受欢迎的图像模型
40:04并通过一个完整的实操流程学会了将它们下载到自己的电脑上并在WebUI里驱动它们出图作画的方式学完以后你对StableDivision里的模型有更了解一点吗?欢迎你在课程的评论区留下这节课的学习心得这节课的作业在前面就已经提到过了
40:20就是把这几个模型新手包里的优秀模型从各自的主页里下载下来并安装到你的WebUI中然后使用它们在同一组提示词下各生成一张图片体会它们之间的风格差异当然为了方便你的长期使用我会推荐你按照课程里演示的方式
40:35给你模型库里的所有选手都打造一张类似的带封面的名片在未来的学习和探索中你还有很多机会去接触并运用各种不同模型而在即将开始的下一节课里你将掌握的提示词便是运用它们去出图作画的最重要的一环
40:51我们会详细聊聊在SDWeb UI中书写提示词的基本方法以及如何利用各种提示词的规则来精细控制画面内容并帮助你翻开它的底层逻辑为你总结出一套WebUI里的提示词之道感谢你的收听这里是Nenly我们下节课见咯拜拜提示词又长又复杂
41:29有时候还会穿插着各种奇怪的数字符号在即将开始的这节课里我将带你系统梳理一遍为StableDiffusion模型撰写提示词的基本方式和两种主流书写逻辑并为你介绍WebUI里的一系列与提示词应用相关的功能同时和你分享几条从初学者的角度出发的提示词小窍门
41:46可以帮助你快速学会写提示词的精髓学完了这些你就能成为一位StableDiffusion的提示词高手了准备好让我们开始今天的学习内容吧广义的解释提示词是指用户输入的文本信息目的是指导模型根据一些特定的需求生成图片和艺术作品
42:01直白一点说这是告诉AI我要生成什么生成什么样的一种方式如果把AI比作一位设计师或插画家那我们就像一个甲方一样靠提示词完成和他之间的沟通并下达需求让他开始工作虽然今天的AI非常智能
42:16但它和真正意义上的人类智慧还是有一定差距的很多时候它并不能轻易地知道你想要的是什么因此我们就需要靠尽可能详尽的提示词来更好地引导AI了解我们的需求并生成我们想要的内容这个需求里包含的东西可能是非常广泛的
42:32比如一幅作品的主题、风格和形象特点以及一些具体会出现在图片里的人物景以我曾经绘制过的这一张图片为例不同的提示词分别描绘了这幅作品的画面风格人物体貌、服饰特点、场景内容和一些额外的修饰性元素加起来简直像一篇小作文一样
42:50别看这么多字其实这里面很多关于风格和质量把控的提示词是固定的可以套模板直接使用起来也非常方便看完这节课你就知道它们是怎么来的并且要如何去运用在自己的生成里了所以要想让AI按照我们的需要去生成一张图片
43:05提示词到底该怎么写呢放心松其实写提示词的过程是非常自由的无论你写什么AI都可以给你生成出来我们不妨用上节课下载下来的这个Realistic Vision模型来摸索一下提示词的写法在Web UI中用来输入提示词的区域就是对上方这个大文门框了
43:21前面也提到过Stable Diffusion的提示词需要使用英语来表述如果你的英语水平足够好你可以直接使用英语来组织语言但如果不行你可以选择打开任意一个翻译软件将你的想法用中文输入到里面然后把翻译出来的英语内容复制粘贴进来
43:37我们先从一个比较简单的提示词开始一个女孩手里捧着一束花这里面的所有符号包括逗号 句号呢也需要使用英文的半角符号把生成的尺寸设定成800x800你可以得到一张正方形的图片和之前一样大部分生成参数可以维持默认不变
43:53但有一个参数需要改动一下是下面的这个CFG提示词的相关性它是一个影响模型对提示词的理解能力的重要参数具体的一些内容我们在下节课里会展开讨论对于这个Realistic Vision模型来说最合适的数值可能在1.5到2.5之间
44:08因此我们将它设置为2点生成一张女孩捧着一束花的照片就诞生了如果你多点几次你会发现每次生成的结果好像都会有点不一样无论是人物的外貌衣服还是背景光线甚至是拍摄的角度都有可能不一样
44:23其实AI生徒是有一定的随机性的有很多人把AI生徒的过程比喻为抽卡因为想要生成出令人满意的图片就必须和这些随机性做斗争就像靠运气抽奖一样不过这种随机性本身其实也和你输入进来的提示词有关一个女孩捧着一束花
44:40这只是一个非常概括的描述这个女孩长什么样子穿什么衣服周围环境如何这些东西AI都不知道就只能向阿萌抽卡了那怎么办呢其实让画面变得可控的方式很简单就是让你的提示词变得更加具体提示词越具体
44:55随机性就会越小生成的画面就会越受控制让我来为你示范一个让提示词变得更具体的过程吧首先是人物的外貌特征你可以从发色眼睛颜色等方面入手描写这个女孩的具体外貌描述年龄也有助于快速塑造符合这个年龄段的外貌特征
45:10还有脸上的表情比如微笑其次是她身上的服饰我们让他穿上一件牛仔夹克搭配白衬衫再戴上一个圆框眼镜他处在一个什么样的环境里呢我们不妨把场景设定在户外一片茂密的森林里如果要特别一点那可以让森林里的树变成黄色的
45:27再给地上加一点落叶主秋天一类的石令描述也是有用的这下我们的提示词就比刚刚要详细多了此时再点生成你会发现尽管生成的内容还是有一定随机性的但随机的范围明显变小了产出的结果也更可控了
45:43而和一开始生成的结果对比起来它在细节上也更加丰满了整张图片的观感似乎也变得更好了这就是具体而详细的提示词在生图过程中能发挥的作用虽然要求使用英语书写但你的句子不一定要具有完整严谨的语法结构
45:59像这里我们增补进去的内容都是直接加在后面的读起来其实是不通顺的但AI仍然能将里面所包含的所有信息要素解析出来并根据它们生成合适的画面你可以尝试把里面的一些句子描述的前后顺序颠倒一下结果其实都差不多
46:15我们刚才的所有内容都是输入在上面这个框里的那下面这个框又是做什么的呢在webvi里上面这个提示词框填写的是正面提示词AI会努力把里面的东西呈现在画面里而下面则是负面提示词AI会努力规避里面的内容
46:31让它们不在画面里出现举个例子在刚才我们的提示词里有一个用于描述表情的微笑你会发现AI所理解的微笑大部分时候都是露齿效如果你想让人物不露齿效该怎么做呢我们可以在正常提示词里再做补充描述
46:47让它闭上嘴等等但上传了好几张人物还是在露齿效看来这个提示词不太能起作用怎么办呢这个时候就可以让负面提示词来帮忙了我们在下面的负面提示词框里输入Tees, Green, Open Mouse这种和露齿效有关联的提示词
47:02再点几下生成看现在的人物是不是就笑得温柔内敛多了呢对于任何一种你想要在画面里排除的内容你都可以把它写在负面提示词里当然随着你输入的提示词越来越多这种不听话的情形可能也会出现得更加频繁
47:17但如果你的提示词是丰富且详实的那多生成几张总是能抽到符合你心意的结果的在未来你也有机会使用到一些语意理解能力更强的新模型比如SDXL Flux比起SD1.5的模型它们往往就会更听话
47:32而完成了后面的所有学习以后你还有注入局部重汇类的方式来更有效高效地解决一些提示词层面解决不了的问题到那时候我们再展开聊聊到这里你可能已经初步找到了写提示词的感觉了你可以尝试着构思一些其他的提示词内容
47:49又或者是拿着一套提示词去其他模型上尝试一下问题来了在某些模型上它的生成效果似乎就会显得有些粗糙尤其是Counterfeit、MetaMix这些偏二次元插画风格的模型别着急解决这种情况的方式和第一课里一样只需要把那两段又长又神秘的咒语复制进来
48:07看,生成的效果一下子就变得精致细腻多了为什么它们会有如此神奇的作用?这里就不得不提到Stable Diffusion模型的两种提示词书写逻辑了在目前的Stable Diffusion里你可以使用两种不同的方法来书写一段提示词一种是用自然语言
48:23它对应我们刚刚直接输入英文语句对想要生成的效果进行描述的方式和日常生活中人与人之间进行交流其实没什么两样而另一种更特别一点的方式是使用Tag标签作为提示词的表达组织方式所谓的Tag就是将一些关键的概念元素
48:39拆分成一个个被逗号分隔的单词或词组作为提示词输入给模型像刚刚生成的这个案例我们可以把这句长单句修改成这样的一长串单词这些单词之间需要用英文的半角逗号隔开可以自由换行但行目也要加逗号
48:55点生成你会发现效果几乎和整句是完全一致的对一些具体要素的表现甚至还要更加精准这就是使用tag来生成图片的另一种不同方式为什么会有这两种逻辑的区别呢这还得要追溯到训练这些模型的换接Stable Diffusion模型其实最早是只有自然语言这一种输入的逻辑的
49:13因为他们一开始给用于训练的图片配的文字描述对了,我们也常常把这些文字叫做标注那些图片就都是利用自然语言去做标注的在微调的过程中,训练者也是要给加入进来的图片做标注的如果训练者仍然使用自然语言的逻辑去标注
49:29那就会增强模型对于自然语言的理解我们后面就可以使用自然语言在这些模型上生成图片但目前流行的大部分二次元系的模型普遍在训练时会采用一些二次元动漫图库网站上的图片作为训练素材而在这些网站上为了方便大家筛选图片
49:45就会采用类似于标签的形式对图片进行区分这些标签记录着画面里包含的各种要素包括人物特征 风格样式甚至是以艺术家名字进行标记的样式而二次元模型的微调训练者们就会把它们作为训练标注所以在这样训练出来的模型上生成图片
50:02使用Tag会更容易召唤出对应的要素来从而取得更精确的生成效果要想知道一个模型到底是使用自然语言还是Tag你可以查看作者在模型主页里的一些介绍或者是作者提供的力图看看这些力图使用了什么样的提示词一般就能判断它是更倾向于自然语言
50:18还是标签化的语言而根据我的使用经验绝大多数SD1.5这一代的二次元风格模型都会受到这种Tag机制的影响所以在使用偏绘画、插画类的模型时都可以尝试着用Tag来做图而一些其他风格的模型有可能使用了类似的思路来进行训练
50:34也有可能融合了这些含有标签知识的二次元模型所以也有概率对Tag进行比较好的响应那它和使用自然语言有什么区别呢?其实最基本的书写逻辑和我们刚刚介绍的是差不多的但某种意义上它比自然语言用起来更简单在一个使用Tag来生图的模型里
50:50提示词的书写有时候并不要求使用非常连贯的语句就像刚刚我们所做的那样而在增补新概念的时候你可以直接往后面加入新的Tag来补充描述特征需要修改原有提示词里的内容时也只需要单独针对里面的几个Tag进行修改而利用具体的标签
51:06往往也能够更精准地帮助我们指向特定类型的作品一个比较典型的应用就是用它去增强生成作品的质量我们刚才加入的那一大串咒语便是这样做的正面提示词里出现的Best Quality Masterpiece在那些图库网站上往往是用来标记出最高清最高质量的那一批图片的
51:23而负面词里的Worse Quality Low Quality对应的就是质量最差的那一批所以加到负面里有助于规避类似的特征那就会让图片质量变好Bad Hand Bad Proportion等等也是起到类似的作用而Monochrome Grayscale则有效规避了那部分纯黑白的作品
51:38所以有助于提高色彩的饱和鲜艳程度在大多数情况下使用这些经过了标签训练的模型时无论是生成什么内容我们都会在正负面提示词里预先加入这样的一段保证质量的提示词组合台北使用者们称为棋手式这段棋手式
51:53对大多数基于Type训练的二次元模型来说都是通用的除此之外我们还可以进一步利用棋手式来实现特定模型的风格引导例如绝大多数真实系的模型都会在棋手式中加入Realistic, Photorealistic用来锁定训练素材里那部分真实照片
52:09或是写实主义的艺术作品而与此同时在负面词里加入诸如illustration,anime一类的词汇就可以避开偏动漫绘画风格的作品结果呢就是让生成结果更真更清晰啦同理2.5D类的模型也会使用诸如3D一类的标签词汇
52:24来强化自身的渲染建模质感这里我为你准备了三段不同风格的七手式分别可以被用于我们上节课划分出来的这三个风格大类的模型你可以在教学副导书里找到它以后在应用对应的模型时你都可以尝试着将它加入到你的正负面提示词里
52:40可以显著强化对应的风格特征让我猜猜现在你可能正在准备新建一个文档把它复制粘贴保存下来但其实不用这么麻烦在你的Web UI里有一个专门为类似起手式设计的功能叫做风格预设注意到生成按钮下面
52:56有一个小小的红色画笔按钮点一下它就会打开风格预设的编辑窗口如果你想把一组这样的提示词保存下来只需要在这里面做这几件事第一步在这里输入风格预设的名字第二步在下面分别输入正负面提示词框里要添加的内容
53:12如果你的主界面提示词框里已经有东西了可以点击这个按钮从当前的提示词框里把它们拷贝进来再做编辑编辑好了以后点一下最下面的保存它就会被加进你的风格预设库里了而使用它的方法有很多种第一种是在生成按钮下方的这个选单里展开并选取
53:29如果你保存了多个类似的风格预设还可以复选这样它们会被一起添加进来选完了以后,虽然它们不会出现在提示词框里但在生成完毕的图片下方你是能看到它们被添加到了提示词里的而在选好风格预设以后点击这个按钮,还可以把它们注入到提示词框里
53:46这就是第二种去使用的方式这样可以方便你后续编辑或者去做一些临时的小修改不过,和相机课里我们对于模型分类的定义一样自然语言和tag这二者之间其实也并不存在绝对的分界线因为tag归根结底只是一种更精炼的自然语言表述
54:03本质上它也可以被使用自然语言的模型所理解而在使用自然语言的过程中也会无形之中将很多tag囊括进你的表述里所以放轻松就像我一开始所说的无论你写什么AI都能为你生成出来就像第一节课我们就是用自然语言的描述
54:18在AAM上生成二次元的图片的但随着学习的深入在对图像内容精益求精的同时它们就会成为你不得不去更细致的考虑的一个东西它们影响的也不仅仅是提示词这一环的作用在将来使用一些附加网络模型乃至自己尝试训练模型的过程里
54:34你都会再碰到它们到那时你会更深刻地体会到这节课里所了解到的这些东西的意义所在在这段咒语里你可能会看到很多像这样的括号和数字它们又是做什么的呢其实这些内容是用来增强或者是减弱某些提示词
54:49在画面里表现的优先级的我们把它叫做提示词的权重以我们刚刚绘制的这个画面为例虽然我们输入了夕阳但画面里的夕阳其实并没有特别突出这里面的原因在于你输入了很多不同元素给AI都要它画但它在处理的时候
55:04不一定get得到你最想要的是什么所以可能优先去画了其他内容如果你就是特别特别想要夕阳出现你就可以用这些括号和数字把夕阳的优先级增强在Web UI里去增强提示词权重的方式有两种一种是加括号在提示词两侧加上这种原括号
55:22注意还是英文半角的它的权重就会变成原来的1.1倍相对于其他元素就会更突出你还可以套多层括号每套一层就再乘以1.1倍三层就是1.331倍看在我们加了三层括号以后夕阳就出来了
55:37另一种方式是括号加数字权重加了一种括号以后你可以直接在后面加一个英文引号然后打一个数字用这个数字直接定义它的权重比如1.5就是原来的1.5倍看夕阳变得更突出了所以当你觉得这个画面里
55:53有你告诉了AI但它又没有生存出来的东西时就可以借助这些方法来强调加数字的方式明显更准确而加括号在进行微调的时候就更方便而如果你想削弱某一个提示词的影响就可以赋予它一个小于1的权重数值
56:09或者用方括号会把权重削成原来的约0.9倍这种强调不光可以被应用在描述具体内容的部分也可以被应用在对质量做出规范的部分就是我们用的这套棋手诗啦在对负面内容进行强调时我们也普遍会习惯把这些坏东西的权重拉高一点
56:25让它们更不容易出现所以现在你能看到这些东西代表着什么了吧不过也要注意一件事情无论是正面还是负面提示词在调节权重时我们要尽量避免个别提示词的权重太高通常情况下用于强调的权重不会超过2当你赋予个别词条一个大于2甚至更高的数值时
56:43它就容易扭曲画面的内容这个时候我还是更推荐你使用一个偏正常的权重然后结合刚刚提到过的一些方式来增强它的表现这种权重机制对使用Tag和自然语言的模型都是成立的而无论是哪一种情况下你都可以把多个词汇多个标签
56:58甚至是一整个句子塞进括号里做强调此时里面的内容会被一起赋予一个更高或更低的权重还有一个小技巧你可以选中一个想要调节权重的词组或标签通过Ctrl键加上下方向键在Web UI里快速实现权重的调节
57:14敲一下就是加减0.1当你想要调节的只有一个单词时不用选中直接把光标停在它上面的任意字母中间再按Ctrl加上下方向键就可以实现调节了了解了这些你就可以更为灵活地在生成中强调你想要的元素了而在Web UI里
57:29还有很多更为深入的语法规则可以帮助你更细致地调控一些生成的细节这些内容在实操中使用的频率并不高对你目前的学习影响并不会很大如果你感兴趣我们会在将来的一些加参课里再进一步展开讨论学到这里你知道该如何写好一个Stable Diffusion的提示词了吗?
57:46如果你已经理解了这几节课里我们所提到的模型训练积累知识的方式那你会明白我们输入进去的任何一个提示词本质上都是在追求对模型里的某种规律的附现它们之间的对应关系就像是字典上的字词和它们的解释一样所以掌握某些特定词汇
58:03就可以非常轻松地实现某些令人惊叹的视觉效果以及独特的艺术风格例如我们第一课里使用过的电影及光效把它加在任何一段提示词的后面然后把权重升高到1.5你就会看到画面立马加上了一层电影感的滤镜连光影好像都变得不一样了
58:19还有一个非常神奇的提示词是空气透视它是一种绘画利用于表现物体远近的激发在大多数模型里使用可以进一步地塑造场景的空间感让作品更富有视觉张力提示词还可以用来调节颜色一个小妙招你可以使用某种颜色
58:34后面加上一个Theme这样的提示词组合在大多数模型里定义整体的颜色倾向像这里输入Red Theme那整张图片就会更偏向于红色系其他色系也是类似的还有一些词语则专注于呈现一种整体的色彩感受例如Multicolor可以营造柔和的色彩
58:51Pastelcolor则是比较鲜艳而富有铜区的粉彩色Sapier则是比较富有复古感的综合色还有无数类似的神奇提示词是我们今天一节课里远远没法分享完的不过受人以鱼不如受人以鱼比起一个个的提示词我更希望分享给你呢
59:06是去发掘这些提示词的途径和渠道掌握它们不仅可以帮助你快速写出一个质量合格的提示词还能逐步积累起自己的提示词能力我把它们总结成了如下的两条小技巧第一条叫做查资料在互联网上有一些收集了Stable Diffusion的提示词
59:23和对应的出头效果的提示词词库你可以用它来直观地看到各种提示词和它们对应可以产生的效果无论想实现哪一种呈现形式或者艺术风格你都可以从中找到参考的提示词结吧而对于Tag训练的模型你可以查阅刚刚我们提到的那些
59:38二次元图库的原始标签百科页面通过它们了解到底有哪些标签是可以使用的以及它们对应呈现的效果是什么样的它们也包括了很多描述体貌特征人体结构姿势或手持细节的内容可以帮助你非常详尽地在每一个方面塑造图片的细节
59:54也有一些开发者将这些标签提取出来制作成了一些可以查找标签的小工具或者是像这样可以分类选取添加标签来组成一个提示词的工具同样我将类似的网站工具地址都汇总在了我们的辅导书里如果你感兴趣可以在课后去逛一逛
1:00:09然而通过这种方式去查提示词也是有一些局限性的不同版本的底模乃至不同的微调模型所具备的知识可能都是不一样的也因此你在这一本资料上找到的提示词不一定适用于那一个模型但无论如何这种查资料的方法可以帮助初学的你
1:00:25快速丰富自己的词汇量并掌握一些在大部分模型上都较为通用的提示词写法当然也有一些方法能帮助你找到更加靠谱的提示词就是我们接下来要讲的第二条技巧抄作业有很多创作者会主动分享自己作图使用的提示词和模型
1:00:41帮助大家获得类似的出途效果此时你就可以去参考他人的提示词写法并将它们运用到你自己的创作中而这种作业一般可以通过两种途径找到一种是专门分享作品和提示词的画廊式的网站例如PromptHero或者Lexica它们设计的作品风格非常丰富多样
1:00:58你可以从中找到很多不同的描述方式另一种则是在上节课里我们介绍过的各种模型网站和AI生图社区里在绝大多数模型的发布页里你都可以看到作者提供的样例图和其他社区用户生成的图片而他们一般都会附上包括提示词在内的各种生成信息
1:01:15例如CVTi点一下右下角的小按钮就可以展开详细的生成信息点这里复制提示词就可以把它粘贴进你自己的Web UI里了因为这些所有图片都是使用同一个模型创作出来的所以这些提示词是有很大的概率能正确帮你复现出类似的效果来的
1:01:31也因此它就像是一份参考答案可以在非常大程度上帮助你掌握手头模型的更多境界用法此外许多用心的模型训练师也会在自己的模型介绍页里附上大量的说明其中就可能包括一些经过验证的可以发挥特定效果的提示词那作者说的
1:01:47肯定也是值得记下来的大部分这些模型平台也都会设有公共的图片分享广场和刚刚提到的那种画廊式的网站一样点进去还可以看到它具体是在哪一个模型上生成的如果你非常想实现类似的效果除了抄抄提示词还可以顺带把同一个模型也下下来使用
1:02:04而在抄作业的时候你也不一定要完完全全地把一整段提示词都给抄下来例如这幅作品如果你喜欢它的人物表现形式和背景元素等等那就主要抄描述内容的部分但如果只是喜欢这种风格和画面质感那可以通过筛选把描述风格的部分提炼出来
1:02:20配合自己描写的主体元素让自己的作品也具备类似风格对于其中产生了良好效果的这部分你还可以用类似于风格预设的方式存储下来让它们在你之后的渗透时间里提供更多的帮助不过需要注意的一点是即便抄了同一套提示词由于AI模型的随机性
1:02:36它不一定能非常准确地就把所有你想要的东西都一次性地还原到画面里而想要做到完完整整的复现除了提示词还需要将下面的一系列生成参数也做同步设置正好下一节课我们就会对这一块的内容做进一步的分析了了解了这两种方法以后
1:02:52相信写提示词对你来说就不再是一件那么有压力的事情了但其实最有力的提示词工具还是一颗富有想象力和创造力的脑袋不管你有什么样的奇思妙想你都可以尝试着将它放进提示词里然后观察它会和AI模型产生什么样的化学反应
1:03:08而无论是查资料还是抄作业最重要的并不是复制粘贴这一步而是利用它在WebUR里做更多尝试探索的这个过程归根结底写提示词也是一件首能胜强的事情积极地去表达自己的想法并让它不断和AI模型碰撞出火花
1:03:24你就能慢慢积累起在Stable Diffusion里潜词造句的能力最终成为一名提示词高手了在这个表达的过程中你可能仍然会碰到一点技术方法或是语言层面的障碍不过不用担心WebUI里有许多功能强大的扩展插件可以让你写提示词的过程
1:03:39变得更加轻松舒适当你学到第二部分的第13课时就会有机会接触到啦以上就是本期视频的所有教学内容啦在今天的这节课里我们了解了提示词的意义和作用以Stable Diffusion中的文章图功能作为切入口掌握了在WebUI里书写提示词的基本方式
1:03:55分析了WebUI中常见的两种提示词书写逻辑其手势的应用以及权重机制的使用方式并介绍了两个能帮助你快速写好提示词的小妙招学完以后你知道该如何利用提示词创作一幅符合你心意的AI章图作品了吗
1:04:10欢迎你在课程评论区留下这节课的学习心得我猜你是有把握的所以在今天这节课的作业里我为你留了一个小小的命令作文请使用Realistic Vision模型生成一幅含有人物和风景的照片具体的人物特征和风景需要包含的内容我已经用中文在教学部的书里为你写好了
1:04:27但我也非常欢迎你在这上面尝试着自己为画面添加一些有趣的元素如果你能顺利生成一张符合要求的图片就说明你是真正掌握了写提示词的基本方法了希望它们可以帮助你开始适应Stable Diffusion的提示词系统而如何利用提示词去实现更多令人惊叹的视觉效果
1:04:44以及独特的艺术风格最终生成一幅富有欣赏价值的AI生成作品会是接下来很长一段时间里我们要一起去探索呢我会推荐你马上接着收看接下来的第四课因为它所讲的内容和你使用提示词在文生图等板块里进行的所有操作
1:04:59都是息息相关的你将了解到包括尺寸 采样器 相关性等在内的各种参数对你的生成过程产生的影响以及如何利用它们更好 更高效的生成图片感谢你的收听这里是Nelly我们下节课见拜拜我的目标就是来对这些参数做一个简单清晰的讲解
1:05:42从而帮助你在之后的学习里更灵活地调整设置它们而通过了解WebUI里的参数浮现机制你也将掌握一键同步作业参数的方式从而更可靠地实现你想要的生成效果借助这个机会你也将有机会对AI生图的原理做进一步的探究和了解准备好 让我们开始今天的学习内容吧
1:05:58在WebUI里我们主要的参数调节都是在这一片区域里完成的这里的参数比较多为了方便大家记忆我把它们分成了两大块分别是生成参数和采样参数所谓的生成参数就是和生成行为产出图片相关的一系列设置
1:06:15其中最基础的一项就是生成图片的分辨率也就是这个宽度和高度了在图像处理领域里我们一般用宽定义图片的横向的尺寸而高则是纵向的你可以像第一课里那样按照需要的比例设置这个宽和高从而生成各种尺寸比例的图片
1:06:32分辨率首先影响的就是生成图片的质量默认的分辨率是512x512但这个分辨率下的图片哪怕细节再丰富看起来可能都是很模糊的但如果我们稍微提高一点到700-800左右再生成一张是不是就显得高质量多了呢
1:06:47但是分辨率设置的太高也是会有问题的首先更高的分辨率需要更大的显卡显存来做支持如果你的显卡显存并不高那在生成过高分辨率的图片时就容易卡死或是报错同时分辨率设置的太大了还容易让你的图片变得很奇怪
1:07:03比如明明我们只写了一个人但画面里可能会出现两个人明明写了一辆车但生成的图片像是两辆拼在一起一样这种现象会产生的原因是因为每个模型都有一个最佳的分辨率这个分辨率一般由它的底膜来决定例如SD1.5的最佳分辨率是512x512
1:07:20而SDXL和SD3.5则是1024x1024之所以是这个尺寸可能和之前模型用来训练的图片有关比如SD1.5训练的图片大部分都是512x512的但在生成的过程中他处理这个尺寸的结果肯定就是最为得心应手的
1:07:36而当分辨率超出了这个尺寸太多的时候他可能就会误以为这个图片是由多张图片拼接而成的从而出现多人多头或者是类似于几张图拼在一起的混乱情形对于这些有最佳分辨率的模型来说在这些最佳分辨率上生成
1:07:52可以最大程度上确保图像的质量和结构是正常的而想要其他宽高比例一般也会围绕着这个尺寸去生成一般来说我们有两种方式可以去确定某一个比例下的分辨率数值一种是让生成尺寸的宽高成绩接近于原始分辨率例如在SD1.5模型上
1:08:09生成16比9的横屏图片很多人会采用640x320或672x378的近似尺寸而另一种则是保持宽或高和基本分辨率一致让高或宽延展像我们第一颗做的那样把宽扩大到912来得到一个16比9的比例
1:08:25如果你在烦恼各种常见比例上的尺寸该如何设定在这里我也为你准备了一份汇总表格当然这不意味着你一定只能按照这些比例或数字来设置你给任何一个宽和高它也都是能给你生成的只不过按照这些尺寸去走一般可以有效降低生成过程中碰到这些问题的概率
1:08:42而想要生成分辨率达到1000到2000像素甚至是更大的高清图片一般我们不会直接在这里面填入一个很大的数值而是先采用低分辨率生成再靠高分辨率修复来放大这个我们在后面的第六课里有机会仔细聊聊接下来让我们一起看看WebUI里的批次设置
1:08:59之前我们提到了SD的出图是具有一定的随机性的想要取得更好的效果往往需要反复抽卡来进行筛选如果想要连续生成多张图片除了一次次点以外还可以通过这个批次数量来让WebUI批量出图这两个选项很像
1:09:14但有不同的含义调高批次那WebUI会在你生成一张完成以后再继续生成下一张而调高单批数量时WebUI则会一次性生成多张图片再一起输出和生成更大分辨率的图片一样一次性生成多张图片对设备配置也是有更高要求的
1:09:31在你配置够的情况下调高单批数量可以更高效快捷地得到更多结果此时一次性生成四张是比一张张生成四张要快很多的但如果配置不够就会同样导致卡顿报错此时最好就还是调批次数目嘛如果你想要在WebUI里大量的收卡
1:09:48还有一个小秘诀用鼠标右键点按钮选中这个无限生成你的WebUI就会像被打了鸡血一样开始不眠不休地做图直到你再次右键点击让它停下很邮马在大批量的生成过程中你可以通过下面的窗口实时查看到预览图
1:10:03在进度进行到一半左右时往往就能够看到图片的雏形了如果效果不是你喜欢的也可以通过上方的终止按钮让它及时停下而跳过则会让它在有多张图片生成时忽略手头的任务快速开始下一张了解了生成参数我们再来看看和采样相关的一些重要参数吧
1:10:20采样是Stable Diffusion实现图像生成的主要方式在使用SD模型生成一幅图片时它会在一张完全空白的画布上铺满噪点随后按照一定的算法规划进行一个去噪的过程也就是将其中的一部分噪点去除掉转换成正常的像素
1:10:36AI会根据我们输入的提示词内容引导这个去噪过程从而去除特定部分的噪声来在图片中塑造形象它往往需要通过多轮次迭代来完成伴随着噪点越来越少图片就会变得更清晰更细致同时更具体最终以那个我们需要的模样被固定下来
1:10:53而采样指代的就是这其中去除噪声的这个过程在生成时你可以在下方的预览窗口里看到这一整个过程图片没闪没变化一下就是在进行新一轮的采样而变更各项不同的采样参数本质上就是让这个过程按照不同的方式执行
1:11:09自然会给你的生成带来不一样的结果对这个过程影响最大的应该就是最上面这个采样器和调度器了采样器的本质是一组算法作用就是控制图像生成过程中噪声的去除方式而调度器则负责安排采样器每一阶段的噪声去除速度
1:11:25或者说它的步伐快慢点开以后你可以看到超过十几种不同的采样器调度器琳琅满目地列在这里排列组合起来至少得有几百种吧但不用担心首先这里面有一部分采样器是已经过时了的效果本身就没有那么好或者是被同类型的改良版取代了的
1:11:42我们一般都不会使用其次这里面又有一部分采样器速度比较慢从效率的角度考虑我们用的也比较少排除完了以后你需要记住的大概就是如下几个相对比较泛用的采样器了其中的这个DPM++2N被誉为是一个全能的采样器
1:11:58可以帮助你在绝大多数模型上以相对快的速度取得比较好的效果也因此成为了目前WebUI的默认选项而其他几个采样器也各有各的特点它们之间仍然存在着一定的效果差异但不存在哪一种绝对的更好可能更多取决于主观的感受
1:12:14我会建议你多数时候维持默认仅仅在出现问题的情况下尝试着去调节或者把它作为一个提供更多随机性的额外选项有时候模型的作者也会在主页撰写的相关说明中提供他们认为最适合当前模型的采样器这个时候我也会推荐你
1:12:29跟着作者的选择走对于调度器我们一般都会选择Auto因为它会自动根据设定选择当前采样器最合适的调度程序如果拿不准的话那第一个Kara Spec被公认为是一颗可以提供更高质量的选择多数时候都可以放心地选用刚刚我们提到了
1:12:44这个采样的过程是需要经过多轮次迭代来实现的这个迭代的次数就被我们称为采样步数采样步数的设置和采样器调度器都有一定关联对于大部分采样器来说约20步左右就能生成一项完整的图片适当提高步数一般来说被认为是有助于
1:13:00实现更精细的效果的但在我们常用的集中采样器里大于一定步数以后提高步数的编辑效率并不明显从这个对比里你可以看到在默认的DPM++2M采用器下在30步、50步乃至100步下生成的图片其实差别并不大
1:13:15而提高步数Stable Diffusion的工作量也会显著增加生成时间会等比例变长那花两三倍时间生成一张差不多的图片其实确实没有啥必要所以大部分时候我们按照默认的20步设置即可有需要更精细的情况下可以适当提高到30到40步
1:13:31再高就没必要了而降低步数可以节约一些生成的时间尤其是在运行一些较大的模型时但同样不能太低因为在较低的步数下图像无法成型生成的质量也会有显著影响注意这个规则并非对所有的采样器都生效
1:13:47一些采样器比如这个DPM++3M SDE在更长的步数上可以创造出更精细的效果而一些采样器比如UNI-PC Restart在更短的步数上也能提供不错的生成效果还有一类特殊的祖先采样器包括ULA-ADPM++ SDE等在内
1:14:03会在采样的过程中添加额外的随机噪声从而让生成效果更富有随机性在它们上面增加的步数并不受编辑效应的限制每一步都可能给图片带来新的变化某种意义上它会提供更多的创造力但同时它也是不利于稳定复现生成过程的
1:14:19就我个人而言我会倾向于优先使用那些非组件的采样器做尝试影响步数的除了采样器还可能包括模型本身有一些特殊的加速模型在更短的步数上也能生成一张完整的图片例如我们使用的Realistic Vision模型它是基于HyperSD的底膜训练的
1:14:36只需要最低6到8步就可以生成一张图片这样就可以把生成时间缩短到原来的三分之一还有一些其他技术比如LCM SDXL Lightning都有类似的特性在以后你会逐渐接触到有机会我们也可以在课程里聊聊在下方有一个参数叫做随机种子
1:14:53它是干什么的呢在刚才我们提到了采样是从一张完全随机的造生图开始的而这张造生图就是由一组随机数计算出来的这个随机数就是所谓的随机种子默认的随机种子-1指的就是在每次生图时都使用一个完全随机的新种子
1:15:09在其他参数都相同的情况下随机种子不同每一次生成的结果就都会是完全不同的这便是AI生成图片所有随机性的来源每张图都会有一个自己的种子可以在生成参数或图库浏览器里面查阅到在其他参数都不变的情况下
1:15:25只要输入同一个种子那生成出来的图片就会是一模一样的这个特点可以被我们应用在需要对图片去做一些细微改动的场景里例如当我们对某一次生成的整体效果满意但却有一些细节上的东西无论是提示词还是生成参数的层面
1:15:40需要修改的时候可以点一下旁边的这个回收按钮就可以套用上一次生成的种子数把种子固定下来以后再做修改就可以起到基于原有画面微调的效果了你学会这一招了吗此时再点一下投资按钮就可以恢复-1的随机值
1:15:55继续开始抽卡但要注意同一种子在不同分辨率下生成的结果也是完全不同的因此在固定住种子数的同时也别忘了将分辨率保持一致哦接下来是这个提示词相关性它的英文缩写是CFG主要控制提示词对生成过程的引导强度
1:16:12反映到生图效果上当CFG的强度较低时模型生成的结果往往会比较抽象对提示词的还原效果可能没那么强但生成的图像可能更具有创造性而当CFG较高时模型会更听话地按照给定的提示词条件进行生成
1:16:27但有时候也可能降低生成图片的多样性它的默认值是7大部分基于SD1.5的模型在这个数值上都可以发挥较好的效果如果有部分提示词无法很好地被反映出来可以考虑适当提高它但在对提示词付现要求不严格的情况下
1:16:42适当降低往往可以得到更高质量的结果但在它过高或过低时图像的质感会受到比较显著的影响所以我们一般会在一个相对的安全范围内对它进行设置每个模型的最佳CFG数值也有可能不太一样例如我们使用的Realistic Vision模型的最新版本
1:16:59根据作者说明最佳CFG在1.5到2.5左右同样有时候不同CFG的差异也来源于主观感受的差异在使用一个新模型时我会建议你在各个不同数值上都测试一下看看哪个CFG上的结果是最让你满意的如果你拿捏不准
1:17:15那也可以打开模型的主页看看作者提供的类图使用的CFG数值一般就能知道该怎么做了说到参数上节课里我们提到了如果想要完整复现一张图片的效果光超体是此时不够的还得把各项参数都同步例如我们在ReleaseDivision模型主页看到的这张力图
1:17:33如果你只复制提示词生成出来的结果是完全不一样的但点开这张力图你可以看到我们刚刚所讲解的各项参数都会被记载在其中如果我们把这些所有参数像CFG1.5生成步数6步采样器、调度器还有随机种子
1:17:48都一一对应地填进去看生成的结果是不是就一模一样了这些参数和提示词模型一起构成了一个完整的图像配方而只有当它们完全同步时你所生成的内容才会同步而在使用一个新的模型键我会非常推荐你在模型主页
1:18:04看看作者这些力图的配方是如何设置的很多时候是可以帮助你快速掌握这个模型的基本使用方式的但这样一个个复制下来填写未免有些太麻烦了其实在WebUI里有两种更高效的参数同步方式第一种 粘贴参数并应用
1:18:19在这些网站上一般都会有一个按钮可以一键复制所有的生成参数信息把它粘贴进正面的提示字框里是这样一段又长又复杂的内容它分别记录了生成这张图片所需的正负面提示词和刚才我们提到的各项生成参数还是很长一串对吧
1:18:34但此时按一下生成按钮下面的这个小箭头按钮它就会被自动读取并填入到各个对应的位置是不是特别方便生成一下果然一模一样一个小提示你也可以在生成完毕的图片下面读取到这段参数复制给别人就可以完整地分享这套配方了
1:18:50第二种借助WebUI的PNG图片信息读取图片参数的参数配方还可以把它下载下来然后打开WebUI的第四个菜单PNG图片信息将图片拖拽上传到这里你就可以立刻在右边读取到它所包含的参数
1:19:06再通过下面的按钮你可以将它一键同步到这几个不同的板块里这样也能快速支持你生成一样的内容你可以把自己生成的图片在Output文件夹里找到直接以无压缩的方式发送给其他人也可以同步这份数据之前也提到了
1:19:21图库浏览器也可以以类似的方式读取到数据参数信息会被作为原数据写入进文件里但这些原数据在经过一些其他软件编辑以后可能会失效所以一般只有生成的原始图片是可以这样去读取的会被记录同步的东西
1:19:38除了这些基础的参数以外还有很多比如VAE设置高清修复设置甚至是下面的ADETALER, CONTRONET等插件如果这些插件里缺少对应的模型可能会无法顺利生成所以要切换到自己电脑上有的模型或者关闭掉高清修复当然在后面学到对应的内容时
1:19:54我们也将有机会进一步深入了解并探究其中的奥秘以上就是本节课程所有的教学内容了总结时间到今天的学习里我们系统梳理了SD Web UI中的各项主要的生成参数和采样选项的含义简单科普了去造采样的过程原理并着重解释了包括分辨率
1:20:10采样器调度器迭代部署与随机种子等相关概念同时提及了Web UI中同步设置参数的两种简单方式学完以后你对AI生图方面的各种参数含义有更熟悉一点吗虽然我们讲解的是Web UI里面的各种参数但它们所反映的Stable Division模型的
1:20:26基本工作方式在任何一个UI软件里都是通用的牢记这些参数的含义对你接下来在这个领域里的探索一定会有非常大的帮助而今天的作业也和你学到的这些知识有关你会在我们的教学辅导书里找到一张像这样的图片你需要使用课程上
1:20:42所提及的Web UI里的参数读取功能把它的参数复现出来并同步生成一张一模一样的图片出来我也会推荐你在这个过程中尝试着修改一下提示词体会一下在同一种词下修改编辑图片内容的感觉在下一节课里我们马上要接触WebUI中的图生图功能
1:20:58你将学会利用图像更加高效地引导AI生成指定内容形象的方式并解锁Stable Diffusion的更多有趣玩法感谢您收听这里是南林我们下期课见咯拜拜是我们的Stable Diversion Web UI
1:21:17零基础读本课的第五课在熟悉了模型的基本概念第十次的书写方式与一系列生图参数的含义以后我们来解锁Stable Diversion里最有趣也最实用的一个功能板块图生图你知道吗要想让AI为我们生成一幅作品除了使用提示词去引导它
1:21:32我们还可以通过一张图片让它更好地理解到我们想要的形象是什么样的我们便把这个通过一张图片生成另一张图片的过程叫做图生图这节课我们就着重聊聊它的基本操作和一些需要注意的技术细节了解和它有关的一些参数含义以及如何借助它实现一些有趣的创作方式
1:21:50准备好让我们开始今天这节课的学习内容吧让我们从一个简单的例子上手理解图生图的过程吧荷兰画家杨维米尔有一幅名画叫做《带珍珠耳环的少女》画面中的少女衣着十分朴素但侧身回首欲言又止的神态十分生动
1:22:06营造出了一种含蓄的美感你想试试让AI生成一位富有类似气质的少女吗?我们先从已经掌握了的文生图开始尝试这里可以使用提示词去对她的着装外貌做详尽的描写比如一个女孩的上半身像照
1:22:22她穿黄色衣服戴蓝色头巾还佩戴着一副闪亮的珍珠耳环站在纯黑色的背景前还挺详细的对吧?再加上洗手室来确保一下生成的质量点了几次生成以后你会发现AI给我们生成的结果是有少女了
1:22:37画面里的少女形态各异但好像都差点意思给不到我们想要的世界名画的感觉怎么办呢这个时候图生图就可以帮上忙了我们可以将这张原图保存到电脑上然后在web ui里切换到图生图的标签里在最中间的这个区域
1:22:53你可以以两种方式上传图片一种是点击一下打开资源管理器在里面选中对应文件夹里的图片上传另一种则是直接从文件夹里把图片拖拽进来也能实现上传接下来我们像刚刚在文生图里一样撰写对应的提示词
1:23:09描述要生成的效果随后我们把生成的尺寸设置成一个和原图比例相近的其他参数的含义在上节课里我们都仔细盘过一遍了请按照你正在使用的模型调节好点击生成你会发现生出来的少女和这张画一下子就像多了
1:23:25而且不管你生成几遍它始终都会和原图保持着一定的相似性这就是图生图的基本流程和它能实现的效果了它是怎么做到让生成的结果和原图更像的呢简单解析一下图生图的工作原理它会把上传的这张图片解构
1:23:40提取各个部分的颜色信息比如黄色衣服 蓝色头型然后以一定的比例混合进上即可我们提到的那张噪声图里从而让生成出来的新图片在对应区域的像素有更大的概率和原图呈现出类似的颜色特征这便是所谓的像的根源
1:23:57现在你理解图声图的这个功能是如何运作的了在进行刚才的这一套操作的过程中你肯定会发现偶尔它生成出来的图片和我们提供的也不是很像比如头巾颜色衣服细节等等其实这和图生图的一些设置参数有关
1:24:13图生图里的大部分参数都和纹身图里相同但有一个新的参数也是最为关键的一个参数就是这个重绘幅度它也叫去造幅度你可以通过它控制刚刚我们说的那个将原图混合进噪声的比例而反映到结果上
1:24:28重绘幅度越大那新出来的图片就会越来越不像反之就会越来越像它的默认数值是0.75你可以把这个数值看作是一个可以实现适当变化的均衡数值如果你将它适当降低到0.6左右那生成出来的结果就会变得更像
1:24:44看 头镜和衣服都对了不过 变得更像的副作用是AI的发挥空间就变小了在反复生成时图片的多样性可能会变低从而让结果变得更千篇一律而当它降低到0.5或者更低的时候
1:24:59画面几乎不会有太多的变化但在做一些放大修复的操作时我们有必要保持画面的一致性在那些时候我们就会选择这种比较低的重绘幅度你也可以选择将它提高如果再提高到0.8到0.9那生成出来的结果就更不像了
1:25:15基本和原度对不上号了不过这样做会让你的图片变得更具有发散性适合创造一些新东西在它提高到最大值1.0的时候它的效果就和纯粹的纹身图没有什么两样了总的来说重绘幅度是一个需要根据你自己的需求灵活调整的参数
1:25:31这是重绘幅度由低到高在各个数值上的表现看这个对比,你应该就能get到它所能产生的一个作用了在图层图重绘时,我们设置的生成尺寸最好和上传的图片尺寸是一致的你可以通过点击宽高设置旁边的这个小标尺按钮
1:25:47快速将上传图片的尺寸读取并同步过来而点旁边的这个小按钮则可以交换宽和高的数值但注意,如果你上传的图片过大那可能也要会碰到上节课提到的那种多人多头拼图的问题此时比较合适的处理方式是将它向下换算到
1:26:03接近最佳分辨率的尺寸上再进行生成当然WebUI也为我们提供了一种更快捷的操作方式就是切换到旁边的按比例缩放来快速设定比例像这张图片它的基础尺寸是1200x1600那按0.5倍换算成600x800
1:26:19就是一个相对不容易出问题的尺寸了生成一下这下是不是就OK多了呢而当上传的图片和你图生图输出的比例不一致时WebUI会对图片做一些处理来让它符合这个尺寸处理的方式就由图片下方的这四个选项来决定
1:26:35举个例子我们上传的图片是数百3比4的尺寸而我们习惯输出的是正方形的1比1的尺寸默认的模式是对原图进行拉伸在这个例子里会横向拉伸一点来适应正方形尺寸这样你就会得到一个微胖满的带头劲女孩
1:26:51而剪裁原图则是在图片范围内按最终比例截取出一个正方形来这样人物的头顶和衣服可能就会缺失一部分而填充空白则会在两边额外延伸一点画面凑齐一个正方形但多出来的部分是AI自由发挥的
1:27:06可能会牛头不对马嘴也可能会出现比较生硬的边界感至于最后一个浅空间放大它和拉伸所能实现的效果是类似的但在原理层面执行的操作不尽相同在这个阶段我们暂时不深入地去解释但学完后面和Stable Diffusion相关的底层原理后
1:27:22你大概就知道它和常规拉伸手法的区别了学到这里你可能会有一些好奇图生图的意义是为了生成一张和原图很像的图片吗如果都有了原图那我们为什么还要让AI生成一张新的图片呢它的玩法当然不止于此了
1:27:39首先我们在图生图里提供给AI的这张图片只是一个参考但具体生成什么还是由提示词共同决定的例如我们可以把对衣服颜色的描述修改成蓝色背景修改成城市街道看你就可以得到一个和原图稍有不同
1:27:54但构图形象保持相似的一张新图片了也因此你可以把图生图看作是一种控制构图大体形象的手段有效地降低生成的随机性更高效地取得自己理想的生成效果不过在这个过程里模型是否能顺利读出提示词
1:28:11实现你想要的变化还得取决于重回幅度的高低如果你的改动幅度较大那就应该适当给高但如果追求和原图的相似就稍微降低一点吧除了可以改提示词我们还可以改模型来实现整体图像风格的大变样
1:28:26像我们前面上场的一直都是偏真实质感的图像此时我们切换到二次元风格的MetaMix上面再把重绘幅度适当降低一点生成一下就可以得到一张二次元版的世界名画它的各个部分和原图都是相似的但风格变成了二次元插画风格的
1:28:43这下你知道那些流行的AI滤镜都是怎么实现的啦这种通过在图像图里改换模型转变图片风格的方式也被我们称为风格转绘除了将真实风格的照片转换为二次元风格的你也可以反过来将二次元插画转换成真实照片
1:28:58而最终输出的风格是什么样的就取决于你用什么模型和加入什么样对应的棋手式在这个过程中为了确保转会后的形象和原图相似我们的重回幅度一般会比低一点但也不能太低因为需要给AI足够多的发挥空间实现风格的转换
1:29:14我们可以进一步拓展其实图层图根本不需要一张具体的图片即便你只是乱图乱画它都能为你做出一些令人惊艳的效果来你可以和我来一起实验一下这个非常有趣的玩法使用任何一个可以帮助你去画出一些东西的软件可以是PS
1:29:30也可以是电脑自带的画图然后像我一样在上面随意地画上一些东西此刻想象你自己是一位才华横溢的抽象派大师在画布上呈现你想要的情景蔚蓝的天空深沉的湖水再在近处加上一点翠绿的草地远处是一座巍峨的山脉
1:29:46山顶被矮矮的积雪所覆盖一个女孩坐在一条长椅上安静地注视着远方确实有点抽象了对吧现在把这张图片导入到Web UI里然后把刚才我们描绘的这个场景转换成提示词跟AI交代一遍点击生成
1:30:02看一幅非常好看的场景插画就这样被完成了以上就是本节课程的所有内容了在今天我们主要接触了Web UI中的图生图功能板块了解了图生图的基本操作流程与一些关键的参数设置比如重回幅度裁剪模式等等
1:30:17并进一步延伸讲解了图生图的各种有趣的应用方式学完以后你对这个功能的理解有更深入一点吗为了验证你是否真正学会了在这节课我们也按照惯例要布置一个作业请你按照这节课最后一个案例的操作自己尝试着绘制一幅草图
1:30:34然后借助web ui中的图生图功能选择合适的模型撰写合适的提示词把它变成一幅真正的大作如果你顺利完成了那就说明你已经比较扎实地掌握了前面几节课的所有内容了Web UI中一系列进阶操作的基础
1:30:49掌握它对你接下来许多探索和创作都是有巨大帮助的而马上在下一节课里我们要讲到的这个高分辨率修复就和图生图有着非常紧密的关系它是如何让我们图片变得又清晰又细腻的呢答案都在这节课里了
1:31:05如果你还能学就赶紧开始新一节的学习吧感谢你的收听这里是Nelly我们下节课见了拜拜水深男女你现在正在收看的是我们的 Stable Diffusion Web UI 零基础入门课的第六课
1:31:22在前面的几节课里我们完整的梳理了一遍文生图图生图的基本流程以及和模型相关的各种概念在这个过程中我们学习了很多让 AI 绘画变得更为精致的方式例如选由精度高表现好的微调模型添加和质量有关的棋手式等等除了以上几种手段在 Web UI 里还有一系列功能是专门为了优化产出图像质量
1:31:39让我们获得更大更高新的图片而存在的其中最为主要且直接的一种就是我们今天要讲到的高分辨率修复了它可以轻松让你生成的图片变得精致细腻 细节满满可以说是每个Stable Diffusion的使用者迈向进阶路上必须掌握的一项技巧在这节课里我们就来聊聊它的基础操作方式和运作原理
1:31:56深入解析包括放大算法迭代步数和重回幅度等在内的各项参数对它的影响并了解使用它的最佳姿势准备好让我们开始今天这节课的学习内容吧在之前的学习里我们也提到了受制于模型最佳分辨率的缘故目前大部分模型只能直接生成500到1000像素的内容
1:32:15但几百分辨率的图片在现在的很多高清屏幕上都显得有些不够看了而对于一些偏真实系的图片而言在分辨率过低的时候很多细节都会呈现出模糊损坏的特征因为没有足够多的像素让AI生成这些细节因此我们就需要对图片进行放大
1:32:33来让它变得更清晰细致并修复这些因分辨率不足导致的瑕疵被应用的最为广泛的一个手段就是高分辨率修复了在WebUI里它是纹身图的一个附属功能根据翻译版本不同有些地方也叫高清修复或超分辨率修复
1:32:49我们尝试着用它来放大一下刚刚的这张图片为了确保生成的内容一致我们保持提示词参数不变并将随机种子固定它的基本使用方法很简单将它勾选中就可以在纹身图的过程中开启高清修复点旁边的小三角按钮
1:33:05就可以把折叠菜单打开里面装着所有和高清修复相关的设置参数项我们首先需要关注的是下面这个放大倍率它代表基于下面填入的生成尺寸放大的倍数像我们的原始图片是768x512的尺寸这里填的数值是2
1:33:20就会把它放大到原来的两倍也就是1536x1024像素在右上角你也会读到对应的尺寸变化细节当然除了按照倍数放大也可以借助旁边的宽高数值直接定义最终尺寸但为了保持放大后的比例不变形
1:33:36我们一般都会直接赋予一个放大倍率上面的另外三个参数则控制了这个高新修复过程的具体进行方式在学完了前面几节课以后你应该已经知道包括迭代步数重回幅度这些名词的具体含义了但它们为什么会出现在这里我们一会儿就会揭晓了
1:33:52此刻你可以先按照默认的layton算法进行设置保持迭代步数为0并将重回幅度适当降低到0.5然后点击生成你可以注意观察下面预览窗口里展现出来的这一整个生成过程Web UI会先像往常一样
1:34:07从一张造生图开始采样为你生成一张低分辨率的图像然后它会参考生成出来的形象进行第二次采样去生成第二幅更高分辨率的图像是不是有点像图生图对了你可以粗略地将高分辨率修复理解成是把这个低分辨率成品回炉再做一次图生图
1:34:26通过一些放大算法拉伸到一个更大的尺寸上再重新采样去造一遍从而得到一张和原图相似但分辨率更高的图片我们看这张设置出来的图片它哪里变得更清晰了呢放大点看包括人物的面部皮肤纹理
1:34:41发梢发丝细节再到衣服上蕾丝边的透明感都在告诉你这是一幅更为清晰包含了更多细节的图片这就是在纹身图里进行一次高分辨率修复的基本方式了在了解了这个过程以后我们来一起探究一下这里面涉及到的几个核心参数
1:34:57迭代步数和重回幅度控制的肯定就是这个重新采样迭代的过程就是它以多强的幅度多少步的安排进行这个重回需要说明的是当这里填入的迭代步数为0时它会自动按照你填在文章图参数里的采样步数来设置
1:35:12而当你在这里面填入一个大于0的步数时它就会按照你这个步数来执行而重回幅度对画面起到的控制作用和我们上一节课里展示的类似为了确保放大后的图片和原图足够像它一般不会超过0.7如果太大不仅容易出现不像的问题
1:35:29还会招来大尺寸里容易出现的那几个坏毛病前面这个放大算法的作用主要是体现在我们提到的将图片拉伸到一个更大的尺度上的这个过程里因为一张图片的像素数量是有限的如果仅仅只是拉伸到一个更大的尺寸上
1:35:44那只会让单个像素的占地面积变大并没有真正起到放大的作用细节还是很模糊那这个时候这些AI放大算法就可以通过计算往相邻的像素点间填进新的像素点让图片的细节变得更加丰满做得真正意义上的更大更清晰
1:36:00那不同的放大算法就决定了这个过程的处理方法差异了点开以后你同样可以看到一系列不同的选项如果要深究这里面的每一种不同的算法都会有自己的一种独特的特点但如果简单一点去理解我们可以把里面的这些选项
1:36:15划分成两大阵营浅空间类的和非浅空间类的浅空间并不是一个真正存在于物理意义上的空间而是一种有点类似于压缩后的图像数据状态包括Stable Diffusion在内的绝大部分图像模型都是在这个浅空间里
1:36:31去做训练和推理的因为这种压缩后的状态可以大大提高数据的运算效率所谓的浅空间类的放大算法主要指的就是上面这些以Layton开头的选项相比起非浅空间的选项浅空间类有着一些非常显著的优势
1:36:46首先是它的效率一般会比较高因为在流程上节约了一次额外的编解码其次因为它在放大时是以浅空间这种更为底层的形态进行的所以会更有利于为图片添加一些细节从而使得高清放大以后的图片显得更加生动自然
1:37:02但这些优点在很多时候也会变成一种缺点比如它其实相比起来也更容易让图片改动幅度过大给画面加细像这个例子里你会发现人物的外貌盔甲的样式都变了辫子也多了一条背景的墙上还多出了一块砖
1:37:17你或许会想到里面的宠惠幅度设置没错降低宠惠幅度可以有效避免这种加细的情况出现但对于浅空间类的放大算法而言有一个比较致命的地方在于它不能以太低的宠慧幅度进行这个放大过程
1:37:32最低0.5再低可能就会出现像这样的造生没去干净的痕迹从而影响画面整体的观感所以在本质上浅空间类的这些算法会给你的这个放大过程带来更多的变化和不确定性而非浅空间类的这些算法在执行上体现出的特质
1:37:48就是相对稳定且温和的它可以支持最低0.2到0.3的重回复度在这种情况下放大后的图片和原图会维持较高的一致性如果你设备条件比较好那多花的一点点时间其实也不至于构成一个缺点但在使用一些真实系列模型时
1:38:04可能会导致生成的结果缺乏纹理和细节变得比较油腻总的来说在这个放大的过程里如果你希望为图片添加更多细节那可以使用浅空间类的算法搭配比较高的重回复度而如果你希望更多的保持前后相似那可以使用非浅空间类的算法
1:38:21搭配较低的重汇幅度至于每个大类底下的各种不同算法其实都各有千秋但反映到结果上尤其是在放大的幅度和重汇幅度都不太大的情况下它们之间的差异真的不算很大对于我个人而言
1:38:36在应用浅空间类的算法时我一般会选择这个默认的什么都不带的Layton其他几项的差异主要在于放大以后的一些差值方式影响不是很大而在运用非浅空间类算法时默认提供的选项里这个RESRGAN应该是被应用的比较广泛的
1:38:52公认效果不错的而且耗时不会很长的一个我会推荐你使用值得一提的是里面有一个和它特别像但后面多了一个Animum 6B的是它针对动漫类图像做的一个改良版如果你使用的是一些片二次元系的模型那使用它效果会更好一些
1:39:08在上上节课提到的读取参数的过程里如果你的图片经过了高清放大那也会把这部分的参数一并读取到包括它的放大倍数使用的算法等等都已并设置好但在这里面你可能会看到一些不在这个魔人列表里的选项
1:39:23比如这个4倍NMKD Superscale它又是干嘛的呢其实放大算法和Checkpoint一样是由一个不同的模型文件支撑起来的而除了列表里记载的这一些以外也有一些比较新的不在列表里的如果直接运行
1:39:38就会因为缺少对应文件报错需要你自己把它下载下来然后放进指定文件夹里才能被读取到像这个模型你也可以在Hugging Face上找到把它下下来以后放进WebUI跟Modus文件夹里呢ESRGM文件夹下就可以在WebUI里顺利读取并使用啦
1:39:56看,这个比较独特的算法可以为你的生存结果赋予更多皮肤纹理上的细节所以有很多画人像的模型其实还蛮喜欢使用的还有很多类似的放大算法我也把它们汇总到你的辅导书里了如果你有需要就去看看并下期下来试用一下吧
1:40:11聊了这么多关于放大过程的原理和算法间的差异我想你已经大概了解了高分辨率修复要怎样使用了不过它是一个负担比较重的选项因为开启它的时候生成的图片面积翻了倍生成一次的工作量就等于常规情况下的好几次
1:40:28耗费的时间会成倍增长对于一些设备比较差的同学来说耗费的时间可能会更长而AI生成又是具有一定随机性的在得到一张满意的结果签你肯定需要经历一个漫长的抽卡过程但开这么笨重的高分辨率修复去抽也有点太煎熬了吧
1:40:44其实在应用高分辨率修复的过程中有很多小技巧是可以让你的操作过程变得更加高效且丝滑的首先你可以考虑适当降低一点高分辨率修复的采样步数因为高分辨率修复并不是从一张造生图开始从零采样的
1:41:00所以它需要的采样步数往往不如常规的纹身图一样那么多你可以考虑适当将它降低到常规采样步数的一半左右从这次对比率你可以看到最终的结果差异并不会非常大但可以帮助你节约很多在大尺寸上采样的时间
1:41:15但这一点也并不绝对在放大倍数差异较大或是采用浅空间类的算法时保持或适当延长部署也有可能取得更好的效果再需要根据你使用的模型和生成内容做一些尝试在因地制宜的制定合适的方案
1:41:30相比之下另一个方法可能会更加实在一点就是在抽卡阶段不去应用高分辨率修复就像这样在低分辨率下反复抽直到得到了一张让你满意的图片以后我们可以再重复读取参数或是回收按钮将它的随机种子固定下来
1:41:46然后再使用高分辨率修复这样在收卡阶段我们的速度是完全不会受到影响的而只需要在自己感到满意的那一个种子上进行更漫长的放大过程还有一个更简便的实现这个过程的方式当你在文章图里得到了一张让你满意的图片以后
1:42:02你可以先在高清修复的选单里将算法重回幅度等设置好然后点一下预览图下面的这个星星按钮这样它会跳过重新生成这张图片的过程直接进入高分辨率修复阶段最终把它的放大版吐出来怎么样还挺方便的吧
1:42:18掌握这些使用的姿势你就可以在进行纹身图的时候充分利用它来让作品变得更清晰细致了诶那图生图里可以用吗其实如果你想在图生图里实现类似的分辨率升级那只需要将这张比较模糊的图片导入进原图区域
1:42:34再利用按比例缩放设置一个放大倍数同时写好提示词设置合适的重回幅度再重新生成一次就好了没错因为高分辨率修复本来就是一次额外的图生图嘛在这个过程中如果你选择的缩放模式是拉伸
1:42:49那得到的效果会类似于刚刚提到的非浅空间类算法所能实现的效果也可以应用较低的重回幅度但此时如果你选择的是第四个浅空间放大那就会采用浅空间类的算法进行处理和刚才是一样的细节可能会更多更丰满
1:43:06但重绘幅度不能低于0.5无论是在纹身图还是图身图里执行类似的高分辨率修复操作其实思路都是相通的但他们也会面临着一个同样的问题就是在更大尺寸上绘制所带来的设备显存压力不过不用担心
1:43:21在WebUI里藏着很多神奇的放大修复功能可以帮助你以更加轻松的方式优化图片的质量在马上开始的下一节课里我们就会讲到啦以上就是本节课程的所有教学内容啦来做一个总结在今天的这一节课里我们系统讲解了和WebUI里的高清修复有关的功能的知识
1:43:39包括它的基本操作流程、运作原理、各项参数设置的含义并介绍了各种放大算法包括浅空间和悲浅空间类算法的一些差异和设置要点同时熟悉了在实操中运用高分辨率修复的一些技巧和姿势学到这里你知道该如何在WebUI里
1:43:55进入它产出分辨率高且精细的高清大图了吗?这节课的作业如下请根据所学的知识使用人意模型在Stable Diffusion WebUI中生成影像分辨率在1000像素以上的高清图片内容题材不限在使用高分辨率修复的过程中
1:44:10请根据你的生成内容合理选择算法并设置重回复度如果可以请在提交事务上放大前的图片作为对比可以更直观地和大家展示你的放大成果当然如果你的设备配置不足以支持特别大的尺寸那你可以选择适当降低放大的倍数
1:44:27在这种情况下它一样会让你的图片变得更加细致而正如刚才所介绍的一样马上要展开的下一节课就会讲到WebUI中的两种更为轻量级的放大方式它们一定会带给你一些不一样的思路和体验我猜你一定已经准备好继续学下去了
1:44:42感谢你的收听这里是Nelly我们下节课再见拜拜包括使用巧妙的分块技术
1:45:04降低负担的SD放大脚本还包括操作更加简便但却可以灵活调用诸多算法和修复功能的附加功能处理同时我们还会借这个机会了解一下在Web UI中进行批量处理的方式学完以后你会进一步丰富自己在使用Stable Diffusion生图时对质量进行提高优化的手段
1:45:19并懂得如何根据不同的应用场景选择合适的方法进行操作话不多说让我们开始今天这节课的全系内容吧在上节课的结尾我们讨论了高分辨率修复作为一种放大手段的弊端虽然它用起来很简单但它生成起来耗时长
1:45:34占用资源也多尺寸过大时还会有爆存的风险有没有能解决这些痛点的办法呢Web UI的开发者们很早就意识到了这一点所以提供了一个非常巧妙的解决方式就是我们接下来要讲到的SD放大脚本了严格意义上来说
1:45:49它是一个图生谱的附属功能让我来为你梳理一下它的基本使用方式吧首先你可以用你喜欢的方式生成一张低分辨率的成品图如果你是使用纹生图或图生图制作的那在阅览图的下方你可以找到一个这样的画框按钮点一下就可以把你的成品图
1:46:06连同提示词等参数快速发送到图生图的界面里并填充进去然后像之前做的所有放大操作一样调整好各项采样参数这里的重回幅度同样不能太高推荐设置在0.3到0.5之间做好这一切准备以后
1:46:21你可以将界面滚到最下面有一个脚本的选项这个菜单在维生图和图生图里都有而且藏着很多Web UI里非常实用的复始功能我们要找的SD放大就藏在这里面了你可以在这里面设置一系列和放大相关的参数
1:46:37放大倍率自然不用多说而放大算法的作用和上节课里我们提到的一样你可以按照自己要放大的图片类型灵活选择合适的算法设置完毕以后你就可以点击生成了在生成过程的预览里你同样可以观察到这个功能的运作方式
1:46:52但它好像和常规的图生图有点不一样其实它正在做的事情是按照一定的逻辑把原图拆成了一个个小块然后针对里面的每一块单独做一个类似于高清修复的放大再采样的过程最后拼在一起为你输出成一张像这样的成品
1:47:09把这张输出的图片保存下来看看尺寸果然放大到了原来的两倍是不是还挺生气的这种处理图片的思路也被我们称为分块放大而通过分块再重新拼接它可以将生成一张大尺寸图片的压力
1:47:25分化到一个个小块上从而大大提高它的生成速度并显著降低现存的占用在这个分块的过程中有一个影响它操作的核心因素就是这个图块重叠的像素了这个重叠指的是什么呢其实如果把图片直接一块块拆分开
1:47:42那拼合的时候可能就会产生像这样比较生硬的接缝边缘对成图效果不是很有利于是SD放大就采用了一种比较灵活的思路在分块之间预留一定的重叠区域来进行过渡加了这个重叠以后在生成一个新块时
1:47:57SD放大就会部分参考旧块的内容来确保两幅画面衔接起来是有连贯性的这样图像组合在一起就会更加丝滑几乎看不出拼接痕迹来这就是重叠的意义所在了对于尺寸在512像素左右的原图64像素是一个还OK的数值
1:48:14而当你在生成完毕的图片上能看到像这样比较明显的区块感知就可以考虑加大重叠来让不同区块间的过渡变得更加自然越大的原图可能也需要越大的重叠来确保图块过渡丝滑但接缝越大分层的总快速就越多
1:48:30生成的时间可能也会更长这一点是你在使用SD放大的过程中需要注意的总的来说SD放大是一种非常优秀的放大手段使用它去进行放大是几乎不会受到显存限制的按照这里面的参数你最大可以把图片放大到原来的4倍左右
1:48:46轻松产出2000像素左右的高清图片而与高分辨率修复对比起来它也不容易给画面加戏像一开始介绍的一样我一般建议你在0.3到0.5的重回幅度间进行这个SD放大的操作可以在确保前后维持一致性的情况下
1:49:01为画面添加合理程度的细节不过嘛它也有缺点当重回幅度过高时它给画面带来的破坏就不仅仅是局部加戏这么简单了由于我们输入进来的提示词对每个分块都是生效的所以在拆分成长的时候就会导致每个区块
1:49:16都会出现像这样似是而非的小人或是奇怪的肢体片段但也不用担心这种情况并不常出现而当你碰到的时候只需要降低宠毁幅度一般就可以避免了除了SD放大脚本以外还有一种更加轻便的放大操作就是利用WebUI的后期处理标签
1:49:33调用放大算法进行放大你肯定很早就注意到这个标签的存在了那今天就让我们来看看这里面都有些什么样的功能吧这个板块里最核心的一个功能就是第一个图像放大你可以把一张准备放大的图片导入进来在利用纹身图或图生图
1:49:49生成一张低分辨率图片以后你也可以通过下面的星星按钮将成品快速发送到这个板块里来随后勾选它并展开进行设置在最简单的情形下你只需要选择一个基本的放大算法没错还是这些熟悉的老朋友们再设定一个缩放比例
1:50:05就可以用这个算法把它放大到原来的指定倍数点右边的生成就可以开始放大了它的处理就更快了几秒就可以处理好而且一下子就可以放大到原来的4倍看看成品是不是比原来要更细腻清晰了呢在这个菜单里
1:50:20WebUI支持你同时利用两种算法来进行放大选了第二个算法以后再给它设置一个0到1之间的可见度它就好像我们给提示词设置的权重一样控制两个算法协同作用于这张图片的比例但它对图片本身的修改幅度就不大
1:50:35如果你不想考虑这么多那也可以不选只靠一种算法也能发挥不错的放大效果在这里做图像放大还有一个非常特别的额外功能就是面部修复看到下面的这个GFPGAN和CodeFormer了吗它们就是两种用于修复人物面部的
1:50:51十分方便的算法很多低清模糊的图片里人脸都是难以识别的重灾区而这两项算法最开始就是为了修复模糊的人像照片而被开发出来的当你上传一张带有模糊人脸的真实照片时可以把他们中的任意一个打开
1:51:07同样是借助可见度调节作用强弱这样在执行了放大以后这两个算法会将图片里的人物面部自动修复还原至一个相对清晰的状态这两种算法里Codeformer的效果可能会相对好一些但耗时好像会稍微久一点
1:51:22两种算法可以单独使用也可以一起用在课程里我们就不追述区别了但非常推荐你自己实验一下这个附加功能里的放大和前面我们介绍过的两种又有什么差别呢其实如果你把它和前两种放大方式输出的结果拿过来对比一下
1:51:37你会发现从效果上说它也放大了一些但明显是不如高分辨率修复和SD放大这么精细的造成这三个操作方法之间区别的原因主要在于它们是否有进行二次采样用比较简单的话说前面两位选手都在放大后进行了一次额外的图生图
1:51:54但附加功能里的放大并没有单纯靠放大算法去放大能实现的效果就会相对比较粗糙一点只有经过了二次采样那图片的细节水平才会有更加实质性的提升但也正因如此附加功能里的放大也是这三种方式里
1:52:11最能维持图片一致性的同时也是最节约时间且最不迟配置的到这里我们可以综合地对比一下这三种放大处理方式的优点和缺点了就我个人的经验而言在主要使用纹身图且电脑配置比较好的情况下高分辨率修复
1:52:26确实是最省事且一步到位的放大选择配合我们上节课里提到的抽卡固定种子再放大的流程可以稳定高效地产出高清的大图而在配置一般的情况下无论是用纹生图还是图生图最终将结果再导入图生图里
1:52:41开启SD放大脚本进行处理会是最稳妥且有效的放大选择附加功能里的放大处理其实就我个人而言并不是很常用因为它对画面细节的实质性丰富并不多但在你图片本身细节不至于太模糊的情况下可以使用它锦上添花的
1:52:58提高一点最终输出的分辨率当然这三种方法并不是全部随着我们的学习逐渐深入尤其是学会了如何为WebUI新安装扩展以后你还将发掘出更多先进且有效的放大和细节修复的方式而在这个附加功能板块里
1:53:13其实还有其他的很多功能例如分割图片自动焦点裁切等等它们中的大部分是服务于模型训练的在日后和模型训练有关的学习中你一定是有机会接触到它们并体会到它们带给你的便利的在这两节课里我们学习了很多对图片进行优化处理的方式
1:53:32而在这之前你一定已经攒下了很多生成效果还不错但在分辨率上不算特别清晰的图片那现在你都可以使用类似的方式去做放大处理了不过要一张张图单独处理未免有些太累人了吧其实WebUI在实现上述操作时
1:53:48都为我们提供了更加方便的批量处理选项让我带你来梳理一下吧在图生图里默认的操作界面是针对单张的图片进行图生图的但在旁边有一个批量处理的小标签将它展开以后在第一个子标签上传这里
1:54:04你可以通过在电脑上一次性拖拽多张图片的方式把它们都加入到这里面最后你就可以批量地对它们应用在图像图里进行的各种操作比如我们想给它们做一个放大那可以像往常一样打开SD放大的脚本再调好参数点生成
1:54:20看它就会一个个地处理完你上传的这三张图片整个过程是全自动的那即便你有一百张需要处理的图片都可以通过这样的方式一口气处理完了除了这种批量拖放图片在旁边还有另一个子标签选择路径在这里面
1:54:36你还可以通过输入文件夹路径来实现批量处理像这里我们把这三张图片装在了同一个文件夹里那就只需要把它的文件夹路径复制下来然后粘贴在这个输入目录里你可以额外定义输出目录这样的成品是可以直接被生成到特定的文件夹里的
1:54:52演生成同样可以非常高效地把这几张图片批量处理完对于附加功能里的放大来说也是一样的这里面你同样可以通过批量拖出来或者输入文件夹目录的方式进行操作这样做在你需要大批量的对一系列图片做质量上的优化时
1:55:08是非常方便快捷的但它也有一个小弊端主要体现在图生图的时候我们是无法根据不同图片设置不同的提示词的只能共用同一套提示词如果你想通过这样的方式实现批量放大那我建议你只在上面留下
1:55:24和质量风格有关的棋手试不过如果你的图片是为VUI生成的在原数据里写有提示词那你可以勾选下面的读取PNG图片信息的选项这样它会自动读取到图片自带的一系列提示词并分别把它引用到生成里
1:55:39从而实现提示词的灵活变化了以上就是本节课程的所有教学内容了在今天的这一节课里我们系统了解了WebUI中的另外两种用于放大修复的方式分别是SD放大小本与附加功能里的图像放大并接触他们之间的对比
1:55:54系统了解了不同放大方式之间的差别和取舍同时我们也学会了使用附加功能类的选项对照片时间并不修复并借助批量处理设置快速标准化的执行图生图或附加功能处理的方式学完了以后放大图片这件事情对于你而言
1:56:10应该就不是一件难事了在这节课的作业里我为你留了一张使用Stable Diffusion生成出来的低清小图请你使用这节课里学到的两种新手法中的任意一种将它放大到一个更大的尺寸上同样我会建议你但在学完了这几种方法以后
1:56:28你可以针对其中的每一种都尝试操作一下横向的对比几种不同的放大方法再向前上来与大家一起分享相信这样比起单纯看课程可以让你体会到它们之间的更多差异在马上开始的下一节课里我们即将接触到
1:56:43VUI里最富有吸引力的一个功能局部重绘利用它你可以高效实现任何对图像的编辑修改靠悄悄提示词就能轻松实现很多传统P图软件里非常复杂的操作如果你准备好了就和我一起开始接下来的学习吧
1:56:58感谢你的收听这里是Nenly我们下期课见咯拜拜克服这种生成的随机性
1:57:27不过在WebUI里有一个功能是专门为了解决这些小瑕疵而生的它就是局部重绘它可以针对一张图片里的某一个特定区域进行重新生成从而实现对画面任意内容的编辑修改小到添加元素抹去杂物大到换衣服换场景之类的操作都不在话下
1:57:43在今天开始的这节课里我将全方位地为你讲解一遍WebUI里局部重绘功能的基本用法参数含义几种不同的应用姿势同样,我们使用一个简单的案例来说明局部重绘的效果。
1:57:59还记得第一课里我们画过的这张图吗?假设这是一个我们反复尝试以后觉得基本满意的画面,但你还想在这个基础上再做改进。提一个不够分的要求,如果我想让这位女生的眼睛闭上,该如何操作呢?你可以加入诸如Closed Eyes之类的提示词,
1:58:15并借助随机种子固定画面,就像我们第四课里做的那样,但你一定会碰到两个问题。首先,即便随机种子完全一致,当你的提示词发生变化时,这个新的随机过程也是相对不可控的所以可能会出现像这样的人换了个姿势画面大幅度变化的情况
1:58:31就会让你距离原来那张你喜欢的图越来越远另一方面如果你的图片已经经过了放大这意味着你要再重新画一张非常大的图耗费的时间就更长了不过此刻的你还有一种选择就是把它一小部分有问题的地方
1:58:46单独拎出来做处理我们来到图生图的标签里因为局部重回是一个图生图的附属功能但它的操作和直接的图生图稍有一点区别你需要先在中间通过这个小标签切换到局部重绘的操作区域随后再导入你想修改的图片才可以进行接下来的重绘操作
1:59:03同样,如果这张图片是使用纹身图或图生图生成的你还可以通过结果预览图下方的这个画板按钮把它快速发送到这里即便你不小心把这张原图传到了图生图里你也可以再通过下面的这几个选项把它复制到对应的选单里
1:59:18当你把鼠标移动到图片区域上时画比比肩使用它可以在图片上涂出像这样的半透明白色区域让这个白色区域覆盖住你想要AI重画的地方例如人物的眼睛涂抹好了要修改的区域以后下一步我们在提示词里输入要编辑的内容
1:59:35提示词描述的画面应当是你修改完以后的画面在这个例子里我们希望人物的眼睛从睁开变成闭上所以可以在开头加入一个Closed Eyes为了确保效果还可以给它适当增强一下权重同时如果原来的提示词里有和这个修改冲突的
1:59:51也要删除掉随后我们往下滑来设置参数和图生图相比局部重绘的界面里又多了一系列和重绘有关的参数你可以先维持默认马上我们就会讲解这些项目的具体含义其他常规的图生图参数就根据我们选用的模型设置好因为我们是在对原画面进行更改
2:00:08所以要将重绘幅度设置在0.7到0.8甚至更高的数值上点生成随后你就可以在下面的预览图里看到这个局部重绘的过程了在重绘的过程中其他部分会变得越来越像我们的原图
2:00:24而被涂抹出来的眼睛部分被新加入的提示字更显出的影响了变成了一双闭上的眼睛并逐渐融入到周围的原图里最后它为我们输出的就是一幅闭上了眼睛的海边女孩的插画了你可以把这个过程简单的理解为
2:00:39是将我们涂出来的这一块区域挖出来单独进行了一个图生图最后又拼回到原图里这就是局部重汇的运行逻辑用这样的方式你就可以自由的指挥模型指挥模型针对画面内部的各个区域做单独的修改了让人物闭上眼睛
2:00:55只是最简单的操作它还可以修改更大范围的内容比如我们把人物的头发全部选中再把提示词里强调的部分改成粉色的头发点生成看人物头发的颜色一下子就改过来了除了改东西我们还可以给画面加东西
2:01:11在后面找一块平静的海面图摸起来然后用提示词描述一下一艘船在背景里的海面上行驶着点生成看,画面里一下子就多出了我们想要的东西了在这个用来绘制局部重回区域的画板里右上角有若干个调节涂画过程的功能按钮
2:01:27上面这个的作用是撤销如果你涂错了可以回退你的上一步操作而旁边的这个橡皮擦则是清空会一次性去除所有的涂抹痕迹下面这个则是控制画笔大小的点开以后会出现一个滑块左右移动可以改变画笔笔触的大小
2:01:43大笔触会让你涂抹覆盖大片区域变得更高效而小笔处适合沿着边缘精细的涂抹当然你可能会觉得这个画板有点太小了当要对图片里的一些小细节做编辑的时候不是特别方便此时你可以把鼠标移到左上角的这个小图标上面
2:02:00这里就藏着一系列让这个画板变得更好用的小诀窍按Alt交轨轮可以控制这块画板的放大缩小而按住F移动鼠标则可以在这个状态下挪动它的位置按S则可以快速进入全面图画模式这样你就可以在一些小角落里进行更加精确细致的图画了
2:02:18你不用担心它覆盖住了下面的其他界面设置和参数因为只要敲一下R键它就会回到初始位置而在这里面按Ctrl键加滚轮上下滚动还可以更快捷地控制画面的大小变化学会了这些技巧你就能更灵活地操作这个重绘涂抹的过程了
2:02:35想要进一步的把控修改效果就需要调整下面的局部重绘参数了和高分辨率修复时一样他们会具体决定这个重绘过程的一些实现方式这里面有一个被反复提及到的概念就是蒙板蒙板是一个图像处理领域的专业名词
2:02:51它常用来描述某一种效果或应用的区域或范围字面意义上理解就是一个蒙住了某些关键区域的板子在这里我们画笔图出来的半透明白色区域就是重绘的蒙板如果你之前有接触过PSC类的图像设计软件对这个概念一定不陌生
2:03:07如果你搞清楚了蒙板是什么那下面这些参数所控制的内容就非常好理解了首先是这个重绘区域在默认的蒙版内模式下我们会把涂白了的区域重新生成外面的区域保留不变但如果切换成蒙版外
2:03:23它就会把画了的部分保留外面的区域拿来重绘像这里我们只涂抹了人物身体的区域但开启蒙版外重绘的区域就会变成除了人物以外的一整个背景所以我们就可以通过这样的方式实现图片的换背景了而为了让重绘的蒙版区域
2:03:40和周围保留的原图能和谐地融入到一起我们一般会给蒙版的边缘做一些模糊处理这个模糊的程度就由上面的蒙版模糊来控制它和我们之前讨论的分块重叠一样也是一种过渡默认的模糊数字是四个像素越大的图片
2:03:56越大的重绘区域可能就需要越大的模糊如果你发现了你的重绘结果有这种比较生硬的边界感那就要考虑试囊提高它同时你还可以考虑将下面的这个柔和重绘的选项勾选并打开它可以进一步提升重绘区域和原图融合在一起的自然程度
2:04:13将它展开你可以看到里面也有许多个设置的参数但多数时候维持默认就可以发挥不错的效果下面的这个重绘参考内容又是什么意思呢刚才我们也提到了局部重绘本质上是把这一块挖出来单独做了一个图生图
2:04:28那这个选项控制的就是我们给图生图输入原图的方式了默认的原图像素就是原封不动的把挖出来的部分输入进去而填充空白则会将它模糊以后再输入至于后面两个浅空间选项则会抛弃掉原来的内容用纯粹的噪声或是纯色来填满这块区域
2:04:46如果你做重绘的目的是对原图进行大幅度的修改那就可以选靠右边的这几项因为它们会留有更大的操作空间去生成内容但同时一般也需要赋予更高的重绘幅度例如在选择浅空间噪声时重绘幅度一般都需要拉满到1
2:05:03否则很难将这些噪声给去除干净而如果你的目的仅仅是微调那选择原图像素会更稳妥一些也可以搭配比较低的宠维幅度来进行操作再往下的这个画布大小又会对宠维的内容产生一定的影响如果选的是原图尺寸
2:05:19那WebUI会基于你的新的要求把整张图重新生成一遍但最后只保留你画出来的这一块区域拼回去如果你选择的是蒙班尺寸那从画面里也能看出来它就会只生成你框出来的这块区域附近把它当成一张完整的图片进行生成
2:05:36然后再拼回去这样做的好处在于可以节约一些生成的时间尤其是在你输入的源头比较大的时候同时由于缩小了画幅在针对一些细节的生成上可能会取得更好的表现但它有时候也容易出现一些问题因为它没法读取图像全貌
2:05:51所以可能会造成重回内容和全剧不够和谐或是这样的画中画的尴尬进行碰到了这样的情形就往往需要对提示词做针对性的修改比如原来的提示词是描述整体人物场景的此刻最好是能修改成针对局部特写的
2:06:07来适应它裁切出来的这一小部分在选择以盲板尺寸重绘时右边的这个外部填充半径就决定了它裁切的整体画幅大小了看这个示意你大概就能明白它的作用了它不存在着一个绝对的最佳数值你可以借用重绘过程中的预览图
2:06:23判断当前裁切出来的画幅是否合适然后再决定是提高还是降低它局部重绘还有一个非常关键的参数就是用来重绘的模型为了确保重绘生成的内容可以和谐地融入原图你选用的大模型最好是和这张图片风格相对一致的
2:06:39理论上你可以使用任何一个Stable Diffusion模型来进行这个局部重绘的操作然而使用普通模型时有时候重绘出来的结果可能会不那么和谐在融入非重绘部分时会出现轻微的错位和比例失衡的情况不过在Stable Diffusion的所有模型里
2:06:57有一类模型是专门为了局部重绘而量身打造的这类模型被我们称为重绘模型在名字里通常带有一个Impainting这些Impainting模型也是基于StableDivision开源的重绘基础模型进行改造得到的直接生成图片的质量可能不如原模型那么好
2:07:13但他们专门针对重绘这种用途进行了额外的训练在重绘时可以更好地考虑重绘区域和原图之间的相互关系从而生成更为和谐的结果所以如果你能找到合适的重绘模型最好还是优先使用重绘模型进行这项工作在诸如Realistic Vision AAM的模型的主页里
2:07:31他们的开发者都提供了重绘专用的型号给大家做选择不过呢即便没有找到也没有关系一来你可以以一个非常简单的方式为任意一个模型创建一个重绘版本这一点在之后和模型室内玩部分的内容里我们可能会再聊聊
2:07:46二来伴随着现在很多微调模型素质的提高直接使用非重绘模型进行绘制一般也可以取得还不错的效果三来即便不使用重绘模型现在也有诸如Ctrl-A一类的手段可以用来保证重绘的和谐这个内容在第二部分的第二时刻里
2:08:02我们会仔细去进行探讨而在进行局部重绘时针对一般生成和采用参数的设置和之前图生图理相接的其实没有太大区别但有几个小的地方是你需要注意的首先是分辨率在采取全图尺寸时这里定义的宽高会等于最终输出的完整图片的尺寸
2:08:19而在采取盲板尺寸时它虽然不会改变图片的输出大小但会决定你裁出来的这块区域以多大的尺寸生成绘制这两种情况下你都要考虑最佳分辨率对生成质量的影响不能太大也不能太小如果不符合当前模型适合的尺寸
2:08:35那要通过倍数去做灵活换算另一个容易导致问题的地方是随机种子它对重绘的内容也会起到控制随机性的作用但是使用参数或图库浏览器发送图片到重绘界面里时很多时候会把种子一起发送过来固定住那这个时候
2:08:51无论你生成几次结果可能都是完全一样的那这个时候你可以考虑将它重新恢复到-1这样随机出来的重复结果就会是不一样的如果一次重复出来的效果不太行那就可以考虑多随机几次总会有一个令你满意的学到这里你应该已经掌握了
2:09:06局部重复的基本用法和这些参数的具体含义了吧在外比用案里除了这种最基本的局部重复以外还有三种更进阶一点的局部重复方式可以在此基础上进一步地拓宽你对图片做更改编辑的方式在局部重绘标签的旁边
2:09:21你可以看到这几个标注着不同名字的标签它们对应的就是这些不同的处理方式了先来讲讲这个有色盲版模式吧它的英文叫做Inpaint Sketch有些地方也翻译成涂鸦重绘大体的使用方法和刚刚的局部重绘好像没有什么不同
2:09:36但在画面的设置下面多出了一个调色盘的按钮你可以借助这个调色盘来自由更改调整你画出来的颜色此时我们图画的作用就不再仅仅是画出范围了它上面的颜色会覆盖掉画面原有的颜色并参与到生成当中
2:09:52举个例子我们可以试着在这张图上面给人物的脸上加上一个带有特殊样式的口罩尽管我们在提示词里做了详细的描述但在普通的重回流程里它其实是很难具体落实的此时有色盲版就能帮上忙了我们把画笔颜色调整为黑色
2:10:09用颜色覆盖住半个面部再画两根连在耳朵上的宝袋随后再切换到白色用更细一点的笔触在这里前前打上一个X点击生成看这个带有XX符号的黑色口罩就顺利加在了人物的脸上了相比起直接的重绘
2:10:25它可以更精确地定义你重绘出来的内容形状从而令重绘更具可控性它也非常适合你想要往画面上添加元素的场景像这里如果你希望在前景增加一棵树那可以用各种颜色把这棵树完完整整地画出来画工比较糙
2:10:41完全没关系因为AI会帮我们补齐剩下要做的事情画好以后再点一下生成它就会把我们的草稿转变成这张图片的一部分了这就是有色盲版的威力所在了它就像是一支马良的神笔一样你画什么它就能给你什么
2:10:56比起一般的局部重绘这种模式下主要多了一个盲版透明度的选项默认0的情况下是完全不透明的但调高它会适当露出一点底下的颜色来可以适当增强原图的存在感如果你觉得颜色重了也可以适当开大一点点让它稍微透明变弱一些
2:11:13在这种模式下我们也一般不会开太大的蒙版模糊数值尤其是在描摹的细节较多的情况下因为蒙版的模糊也会让你绘制上去的内容变模糊一般我们也会想让最终生成的内容更忠于绘制的形象所以重绘幅度可能也会适当给低一点
2:11:29抛开局部重绘其实这个涂鸦的功能也是可以单独使用的对应的模式就是旁边的这个手绘修正在这种模式里你依然可以使用各种颜色覆盖原图的部分但最后它会把你新画上去的内容加进图片里然后重新对整张图做一个完整的图生图
2:11:46这肯定会导致其他部分的细节发生变化所以如果你只是想修改局部就用有色蒙版的重绘模式但如果你想实现前面课程里我们演示的那种灵魂画手感的效果就可以使用这个功能在已有的技术上自由发散局部重绘虽然非常有用
2:12:02但其实还是有点难操作的在针对一些比较细致的地方做涂抹或是要选中比较大的重绘范围时在这个画板里涂抹还是有些费劲的WebUI也非常贴心地为您考虑到了这一点所以它还准备了最后这个上传蒙版模式
2:12:18来帮助你更加精确地控制宠坏的区域范围点击标签以上以下有两个图像上传区域我们照例要在上方传输一张用于宠坏的原图而在下方这里你需要上传一张蒙版图片来告诉你的AI哪里是需要宠坏的
2:12:33我们可以在诸如Photoshop一类的图像处理软件里使用模板选区一类的工具将图片里的特定对象抠取出来随后我们需要将蒙版的范围填充成白色其他部分填充成黑色相比起在WebUI里的涂抹在这些软件里
2:12:48你会有更多的工具来将这个重绘的范围定义得更加精确导出这张蒙版图然后把它上传到下半部分的区域里点击生成看,这下我们的AI就可以十分精确地为你重绘这一块被白色标记出来的人物区域了到这里
2:13:04你应该已经系统地掌握了局部重绘的各种操作方式了但注意局部重会其实不光能修改画面里已有的部分它还能帮助你无中生有在原有画面的基础上向外扩展出更大的想象空间你可以和我来一起实践一下
2:13:20接下来这个有趣的扩图玩法像以往一样我们向局部重会导入一张图片随后读取它的尺寸在它的高度上面稍微加上那么一两百像素然后将缩放模式设置为填充空白点击生成在之前的课程里我们提到过
2:13:35图像图会自动为你填充多出来的这部分画面反映到局部重绘里它则会重复拉伸边缘的像素填充画面而因为我们没有绘制任何蒙版区域原图部分是不会有任何变化的此时把刚刚上传的原图删除掉然后把生成的这张新图片拖拽到重绘区域里来
2:13:53随后我们使用蒙版涂抹刚刚上下延伸出来的这些所有新的区域因为浏览器窗口的问题这部分画面有可能显示不全但你可以通过拖拽右下角这块区域调节画板的尺寸并配合前面提到的那些缩放技巧让它完整显示
2:14:08画完以后在提示词里描写画面整体的内容或是加入你想要扩展的元素来到下面把参考内容的模式设置为浅空间造胜然后将重绘幅度拉满到1盲板模糊可以开高一点或是顺带把柔和重绘也勾上点击生成
2:14:24稍等片刻你就会看到WebUI把这些部分转换为了和原图和谐地衔接在一起的新画面这就是利用WebUI对图片进行扩图的方式了你学会了吗以上就是本期视频的所有教学内容了在今天的这节课里我们了解了局部重绘的基本操作姿势
2:14:40分析了一系列和局部重绘蒙版相关的设置参数的具体含义和作用并介绍了三种由它衍生出来的重绘方式以及利用它巧妙实现扩图的操作方法希望这节课展示的一系列操作能让你充分意识到AI生图的可塑性而为了验证你是否很好地掌握了这一项技巧
2:14:58你需要在这节课的作业里这张人物肖像照片实现指定的操作所需的重绘模型你在教学复导书里都可以找到下载的方式如果你有余力可以尝试在完成重绘以后再使用我们示范的那个扩图的小技巧
2:15:13进一步扩展你的作品画幅在即将开始的下一刻里我们将指面WebUI里的附加网络功能你将通过它接触到Stable Diffusion整个生态体系里最为重要的一系列小模型并见证它们在你生图做图过程里产生的各种奇妙化学反应
2:15:28感谢您收听这里是Nelly我们下期课见咯拜拜有的能在作品里塑造特定的人物形象
2:16:00有的甚至还可以提高画面质量修复措手等AI 上读里的老大难问题这些模型的来历是什么我们又要如何在 web UI 里使用它在这节课以及接下来的两节小专题里我们将着重讨论包括 embedding, loader 等常见的附加网络模型形式在 web UI 里的作用以及基本使用方式
2:16:16也将从它们的身上见识到 SD 模型的无限可能性准备好,让我们一起开始今天的学习内容吧早在第二课里我们就介绍过了和这些模型有关的一系列概念在web ui里对生图过程发挥最主要作用的模型是checkpoint
2:16:32被我们称为大模型但除了这个最大的模型以外还有一些小一点的模型是可以一起配合使用的我们把这些小的模型统称为是stable diffusion中的附加网络它们同样是通过加入额外的图片让模型进行补充训练得到的
2:16:48所以严格意义上来说它们也算是某种形式的微调模型可以补充原始模型里没有的一些概念内容但它们的训练门槛包括对训练数据集的要求或是配置要求等等都比训练一个大的Checkpoint要低很多所以有更多的个人玩家
2:17:04会以这些模型的形式来进行微调以这种方式创作出的海量微调模型在更大程度上丰富了Stable Diffusion的模型生态在今天的Web UI里我们使用者所能接触到的最主流的附加网络类型有两种分别是Embeddings, LoRaEmbeddings模型的学名叫做
2:17:21词嵌入模型Embedding这个词本身就代表着一个机器学习领域里非常关键的概念嵌入式向量简单说它是一种将文本、图像、音频、视频等数据类型表示为数学空间中的向量方便计算机具学习其中规律的技术
2:17:36而在Stable Diffusion里Embeddings发挥的作用也是类似的通过将一系列图片中的关键特征提取成向量从而使得模型在生成时能更精确地定位到这些特征上面实现微调的效果而Lora模型的选名叫做低质适应模型
2:17:52同样简单的去解释它是通过提取了一个大模型的一小部分关键参数专门进行微调来实现接近于对整个模型进行微调的效果因为微调所需的参数量少所以它会更为高效门槛也更低这就是低质适应背后的含义
2:18:08你可以把这两种小模型看作是一个在主网络之外的一个额外的配件它们的加入可以间接地改变模型接收到同一套提示词同一套参数的推理结果从而实现开头我们提到的包括风格转变人物植入甚至是画质提升
2:18:24这样的具体用途它们和大模型之间最直接的差异就是文件的大小了一个正常的Checkpoint大小至少在两个G以上但一个Lora通常只在几十到一百多M最大的不会超过一个GEmbeddings就更小了可能只有几十到几百KB
2:18:41另外一个比较显著的区别就是我们之前提到的能否单独使用你可以独立使用一个Checkpoint不搭配任何小模型来生成图片但这些小模型是无法单独使用的必须依附于一个大模型来生成随着学习的不断推进
2:18:56你可能也会意识到它们之间在概念容量使用灵活性上的一些差异例如Embedded虽然小但对具体概念的打包效果不如Laura好而Checkpoint虽然笨重但能力其实是几种微调模型里最强的但它们并不是全部有一些曾经比较流行
2:19:12但随着时代推移被替代了的附加网络我们现在已经不太习惯使用了例如Hypernetwork、美学T2等等也有一些发挥其他特定作用的网络例如ControlNet、Animative等在后续的课程里我们也会专门讲到它们的使用方法会更复杂一点
2:19:28需要通过额外的扩展插件来对接所以我们在这节课里暂时不会讨论那么在哪里可以下载这些神奇的小模型呢?其实这些模型还是可以在前面第二课里我们提到的各种模型平台和门户网站里找到在使用它们去进行搜索的时候
2:19:45你可以通过对应的筛选选项将它们和Checkpoint之类的大模型区分开例如在C站上我们就可以通过这样的方式只看Lora或Embeddings不过在进行这个筛选的过程中我们还要注意另一项筛选标准就是底膜的版本
2:20:00在训练Lora和Embeddings这两种小模型时我们也是需要选择某一个底膜作为微调的根基的而选择的这个底膜的版本会决定微调出来的模型的架构也因此基于SD1.5的模型训练出的Lora或Embeddings往往只能搭配SD1.5的Checkpoint来进行使用
2:20:18当不同代的模型搭配在一起使用时例如我的大模型是SD1.5的但我的Lora是基于SDXL训练的那可能就会出现效果不佳甚至是直接报错的情况因此在筛选并下载合适的附加网络模型时也需要考虑到我们当前使用的大模型是什么样的
2:20:35如果你使用的是SD1.5的大模型就最好将下方的基础模型版本也勾选上筛选出1.5这一代的Lora in Maddox点进去以后下载的方式是基本一致的有的Lora模型同样可能有多个不同的版本你同样可以在里面看到
2:20:50作者提供的各种力图或是社区用户利用它产出的作品下载的Embedding和Lora同样需要放置在根目桌下的指定位置才能在WebUI里顺利读取到Embedding的位置在外层的这个Embedding文件夹里而Lora的位置在Models文件夹里的Lora文件夹里
2:21:06为了学习这节课和接下来两节课的内容我为你同样准备了几个需要去下载的Embedding和Lora模型同样在教学辅导书里附上了完整的下载地址这节课的任务之一便是将它们下载下来并装载到自己的Web UI里了当然随着学习的推进
2:21:22和你自己的探索逐渐深入你也可以在这些网站上去下载更多你感兴趣的小模型并按照这节课和接下来两节课里的方式去运用它们在文生图、图生图乃至放大、重绘等任何一个环节里你都可以向生成中加入这些附加网络模型
2:21:38而添加它们的地方就在生成参数一侧的这几个标签页里在之前的课程里我们曾经了解过通过它浏览并切换Checkpoint模型的方式而打开旁边的其他几个标签装着的就是你刚才放到文件夹里的这些附加网络模型了
2:21:54我们也把这个菜单叫做WebUI里的附加网络菜单如果是在WebUI开启的状态下往文件夹里添加了新模型那需要先点一下右上角的刷新按钮才能让它们显示出来随着学习的深入你在这个菜单里放的模型可能也会越来越多
2:22:10这个时候有一个小技巧是我想分享给你的你可以在装对应模型的文件夹里再新建一系列字文件夹并且给这些文件夹专门命名像这里我们便可以针对接下来要讲到的这些模型的若干大类来新建一系列的文件夹
2:22:26再把对应功能类型的模型分别装在里面随后你可以在WebUI里点一下刷新按钮旁边的这个按钮就可以把这几个文件夹显示在菜单里并可以通过它们对模型做二次的筛选划分这样平时你浏览挑选模型肯定就会更方便了
2:22:42它同样也适用于CheckPoint的菜单你也可以尝试着用它给不同版本风格的模型做一个更细致的分类刚刚下载下来的模型那同样是没有封面的但你可以按照前面课程里叙述过的操作给它们设定封面、备注等信息在Lora模型的菜单里还可以设置它的相关出发词
2:23:00关于这一点我们在后面的课程里会更详细地讨论把它们加入到生成中的方式很简单下面是一个实操案例你可以和我一起尝试看看我们使用REP Animated模型生成了一张像这样的2.5D风格角色图片在刚才我们下载的这些LORA模型里
2:23:16有一个叫做Blind Box大概是盲盒的LORA可以把图片变成像这样的Q版盲盒风格这个模型下载下来以后的文件名是这样的在把它放进你的LORA文件夹里后你也可以在LORA的菜单里刷到它点击一下这个模型
2:23:32在上方的提示词框后面就会加入一段格式像这样的东西看到它就说明这个Laura被加入到生成里了此时我们可以维持提示词和参数不变再点生成看,一下子风格就变得不一样了虽然风格变了
2:23:47但这张图片的局部好像还是有点不和谐比如人物的手的姿势怪怪的并不是真的在弹吉他不过不用担心此时你可以先点一下负面提示词框把光标移到负面词的后面再打开Inventing的菜单将Fast Negative, Bad Dream, Unrealistic Dream这三个Embedding逐个加进来
2:24:06同样当你点下这些模型的时候它们会变成一个个额外的提示词接在原来的提示词后面同样所有参数不变再点一下生成看图片里人物的姿势一下就正常了不仅如此你会发现整个画面似乎都变得更加清晰精细了
2:24:22连背景里的树都变得更加干净整洁了如果你也顺利地生成了一张像这样的图片就说明你已经初步掌握了这些附加网络模型的基本使用方式了我猜你已经开始对它们的更多有趣玩法给兴趣了不用着急马上我们将在两期专题课程里
2:24:38进一步展开关于这两种形式的模型的知识从而帮助你真正掌握它们的精髓所在以上就是本节课程的所有教学内容了总结时间到今天的学习里我们系统地梳理了SD WebViewer中的附加网络模型的基本概念
2:24:53简单科普了Embedding、Lora这两种模型的形式并体验了在Web UI中使用它们为生成带来更多可能性的方式恭喜你在完成了这节课的学习以后又解锁了Stable Diffusion里一个非常重大的功能板块而今天的作业便是把我们所列举出来的
2:25:09这些Embedding和Lora下载到你的Web UI里并尝试着像课程第二部分里所实践的那样利用它们配合合适的大模型生成这样一张Q版盲盒手办风格的图片在你之后的各种学习探索里你一定会反复和这些附加网络模型打交道
2:25:24到那时你会更深刻地了解到这些模型是如何丰富Stable Diffusion这个生态系统的而在下一节课里我们马上会针对其中的Embedding这一种轻便小巧但却富含无限潜力的模型做进一步的解析你将学会如何利用它
2:25:39去引导AI生成指定的人物角色形象图片风格并显著改善生成作品质量的方式感谢您的收听这里是Nenly我们下节课见拜拜Hi 这里是Nelly
2:25:56你现在正在收看的是我们的 StableDiffusion WebUI 0 基础入门课的第十课在熟悉了复杂网络的基本概念以后今天我们来专门讨论一下关于 Embedding也就是磁嵌入模型的奥秘在今天它可是绝大多数 StableDiffusion 玩家的一个实用的帮手作为一个小巧轻量的只有几KB 的模型
2:26:12它却能在 AI 生图的过程中给我们带来许多惊喜不光可以帮助塑造特定的风格形象更是能给画面带来显著的质量提升你想知道它是如何做到的吗?在今天这节课里,我会带你体验一下SD-Wave UI中各式不同的磁线入模型包括正面乃至负面的embedding在生成里能发挥的作用
2:26:28并掌握一系列让它更好的发挥功效的方式准备好,让我们开始今天这节课的学习内容吧!在上一节课里,我们简单提及了embedding的概念它的精髓在于将许多图像里的特征提炼成了一个向量从这一点上看,它就像是一个把许多提示词打包在一起的小行李箱
2:26:47我们同样用一个简单直接的案例来体会一下你现在看到的这位是动漫电剧人里的人气女角色马奇玛她有着一头醒目的红发深穿干练的装束我们来尝试使用Stable Diffusion生成一个她的人物形象吧这里我选择的大模型
2:27:03是二次元风格的MenaMix如果直接输入人物名字和作品你会发现生成出来的内容和她的人物形象几乎毫无关联这个其实可以理解因为她是近两年才有的新作品里出现的人物角色而这些模型在训练的时候原始的知识储备里
2:27:19可能就没有包含太多和它有关的内容所以我们只能尽可能详细地去描述它的发型着装这才能勉强相似但其实不用这么麻烦在下载下来的这些embedding里有一个就是使用许多它的图片进行训练的角色embedding
2:27:35在web ui中embedding不需要特别的插件和扩展来调用只需要在这个面板里点一下把它的文件名加入到提示词框里就算是顺利调用了如果你记得文件的名字是什么也可以不用这个菜单手打输入文件名效果是完全一致的
2:27:51只要webUI最后在提示词里读取到了文件名就会为你调用对应的embedding我们删掉这些描述只保留这个embedding生成一下即便没有任何关于人物特点的提示词但生成的结果清一色都是粉色头发加辫子穿着白衬衫加领带的
2:28:06这就是embedding的基本用法了在加入它之前模型并不认得马奇马这个角色的形象对这个词是没有任何概念的而加入了它以后模型就认识这个词了知道它代表的可能是这样一位粉色头发身穿正装的少女并给我们生成出对应的形象特征来
2:28:23某种意义上它和前面我们手写的那些描述作用是相近的甚至最终表现出来会更接近这个角色本身的特点所以我们会说它就像是其他提示词的打包合集一样但它的使用和提示词并不冲突像这里在加入了embedding的情况下
2:28:40再描写相似的提示词最终生成的效果会更好更稳定当然它肯定没办法做到和原作里的马骑马完完全全的像因为embedding到头来也就是个几十kb的小文件而发挥作用的时候也只是让AI去按图锁记而已
2:28:55针对角色倾向的创作我们其实更习惯使用Lorash做你会在下一节课里的时候看到相关的内容但对于一些更为广泛容错率更高的形象概念embeddings会是一个性价比非常高的选择例如风格在这一批下载的embeddings里有另一个叫做Color Book Styles
2:29:12涂色书风格的Embeddings它可以让任何一张图片带上一种神奇的线条笔素描画的效果此时我们使用Realistic Vision模型生成了一张可爱的小猫的照片我们把这个模型用相同的方式添加进去看,一下子风格就不一样了
2:29:28还有另外一个水晶雕塑风格的Embeddings同样我们把它替换上去这下这只猫又变成水晶质地的了了解了原理我们应该不难推测出它其实就是把大量同一风格的图片提供给AI进行训练最终把这种特征提炼成了一个词嵌入模型
2:29:45所以我们在加入这个词嵌入的时候AI就可以通过它读懂我们想要的这种风格所具备的一系列特征这下哪怕你不是很擅长使用提示词去做描述只要有了一个这样的词嵌入就可以非常方便快捷地实现某一种特定的风格了
2:30:00这些所谓的风格甚至可以再宽泛一些例如在你像在NinBending里有一个叫做Planets的有趣模型它可以帮助你将图片变成像这样的看起来非常酷炫的产品概念设计图我们试着用它来生成一个相机的设计图
2:30:17还是像刚才一样通过附加模型菜单把这个模型作为提示词加进去等一下怎么好像不起效果了呢生成了几张好像都没有那种感觉我们不妨阅读一下这个模型的主页你会发现作者在说明里推荐了很多对使用这个模型有益的提示词
2:30:34把它们加进去可以更大概率地让你想要的这种风格或概念正确地被呈现出来而查看作者提供的力图你也会发现在生成这些吸引人的效果时他采用了一些特定的句式或是会把关键的提示词放在一些特定的位置上
2:30:50参考了这些内容以后我们再重新撰写一套提示词加入了更多正面负面的元素也协调了整体句子的语序在点上上看结果是不是就显得科学专业多了呢这些有利于模型正确发挥作用的词语往往被我们叫做模型的触发词
2:31:07因为在进行补充的微调训练时AI不光是通过图片本身来学习这种风格的它还会参考图片所具备的标注那这个时候在标注里高频出现的词语、句式往往就会和这种风格产生强烈的关联从而在最终生成时产生了一个触发的效果
2:31:24它对于小模型的使用是比较关键的当模型具备一些触发词要素的时候如果不加进来那生成的效果可能就会大打折扣而在一些LORA模型里你甚至可以通过不同的触发词去触发不同的概念或角色形象但它也不是绝对的
2:31:40有一些模型单纯将它添加上去不使用额外触发词也能取得不错的效果例如前面我们尝试了两种风格但如果你仔细查看这些模型的主页说明和力图会发现也是有一些关联的词汇可以让这些概念更完整地展现出来做到生成表现得更好
2:31:57这个时候你也可以考虑把它们加上此外还有一些embedding在生成的过程中是可以发挥辅助作用的例如这一个叫做Age Slider年龄滑块的Embedding系列可以帮助你非常智能灵活地实现人物角色的年龄切换
2:32:12它有很多个不同的版本分别对应了人物不同的年龄阶段比如Young是青少年,Younger接近儿童而Youngest则带有婴儿的特征而Adult, Mid-Age, Elderly则分别代表成年人,中年人和老年人同样是这样的图片我们固定包括种子在内的所有参数
2:32:29最后加入一个Youngest的Embedding因为embedding本质上也是一系列提示词的集中呈现所以你可以像针对普通提示词一样为它赋予一个权重来增强或减弱它的效果而作者在说明里也提到了将权重适当提高到1.3是可以发挥更好的效果的
2:32:47点上场看,画面里的角色立刻就变得婴儿了起来多了几分幼态和可爱的细细而如果把这个embedding换成了elderly人物就变得老气横秋了这样,在生成的作品中构建人物形象的时候我们就可以不用费劲心力去做很多和年龄有关的描述了
2:33:04而是专注于描述人物的其他体貌特征再通过这个embedding作为一个滑块快速对年龄这个选项进行调节而除了年龄滑块以外这个模型的作者还训练了另外一个性别滑块同样可以灵活地调整人物的性别特征如果你感兴趣
2:33:19就去下载下来使用一下看看它会给你的作品带来什么样的变化吧不过在实战中embedding还有另一个非常奇妙的用途就是被用来消除负面的影响这些所谓的负面影响是什么呢举一个例子就是常见于AI生图里的错手现象
2:33:36早年有很多关于鉴定AI生图的理论其中最核心的一条就是AI生成的作品往往画不好人物的手因为它是用扩散虚造的方式来实现图像生成的所以对人的正常身体结构并没有一个完整的认知就很容易在这些肢体细节上犯病
2:33:52生成出一些让我们很难接受的结果这种现象其实在SD1.5系列的模型也是非常常见的如果你使用我们下载下来的这些模型在不加任何气球式的情况下去生成很容易出现类似的情况而即便用大篇幅把这些现象写在负面词里
2:34:08最终生成的时候也还是很难避免于是社区里的模型训练者们就训练了一系列专门用于针对这种现象去使用的embedding他们记录了一系列这种AI画错了手的方式打包在了一起如果你想让AI画出正确的肢体结构
2:34:24那它就可以被用来规避这些画错了的情形我们来用一下试试看以这个Bedhand模型为例它同样也只需要一个提示词来激活但和前面几个Embedding不一样的地方在于这个提示词需要被放在负面提示词里像这幅画面
2:34:39它是以手部动作呈现作为焦点的那在没有添加Embedding的情况下其实是很容易出现这种手指数目对不上号的情况的此时我们把这个Bedhand嵌入加进去不需要加任何额外的提示词看,手的问题就被修复了这类加在负面词里的embedding
2:34:57也被称为负面词嵌入注意,此时我们其实是没有加入其他任何的棋手式的这就说明,某种程度上它的效果比前面那一大串难写难记的咒语还要更好但同时,它也可以和它们一起使用在训练得当的情况下
2:35:12它对于正面词里的画面内容影响也是不太大的实际上,负面词嵌入能解决的问题远不止多一只手或者少几根手指市面上还有一些其他流行的嵌入模型可以解决的问题可能还包括质体错乱颜色混杂噪点和灰度异常等
2:35:27例如这个Fast Negative模型就是我经常会使用的不管任何形式的图片把它加上去可能都会在一定程度上提升图片的质量不过由于不同类型的图片在负面质量上呈现出来的特征不太一样所以这些负面次嵌入在不同类型的模型上
2:35:43效果可能会有些许差异而我一般习惯在自己的Web UI里常备几种不同的负面Embedding例如这个Easy Negative是基于Counterface去训练的作者测试了对大多数二次元模型都有效而另一款Deep Negative则是主要针对真实风格模型来训练的
2:35:59据2.5D类的作品我习惯使用DreamShaper作者训练的这个Bad Dream它还有一个叫做Unrealistic Dream的增强真实感的配套负面线路在想增强画面真实感的时候可以一起用上这些所有的模型大小其实都不超过那么几十KB
2:36:14使用起来也很方便点一下将进去就好了而它们之间的作用并不互斥加入多个embedding也是可以同时发挥作用的就像我们上节课最后示范的那样不过由于embedding这种模型的特性它对于很多概念的实现其实是并不稳定的
2:36:29在前面使用正面嵌入的时候你可能也已经感受到了而在负面嵌入里我们也不能打包票说这些负面嵌入就能解决所有问题而伴随着不断的训练和融合如今大家使用的checkpoint素质也越来越好了很多时候不一定需要这些负面嵌入
2:36:45也能取得不错的效果这个时候一些负面嵌入模型反而可能会化射天阻给本来正常的画面带来一些奇怪的效果但在大多数情况下你都可以看到它们对画面整体是存在一定的改善作用的所以遇事不决你可以考虑先开个负面embedding
2:37:02但如果你感觉它对你的画面质感造成了影响那你可以选择把它去除掉另外一些被用于概念植入的embedding可能也存在着负面选项例如前面我们提到的年龄滑块作者也准备了两个负面版本放进负面T4框里可以排除掉对应特征,不失为一个额外选项
2:37:19如果你感兴趣,可以下载下载使用一下这样你一定能更清晰地体会到磁嵌入模型的特点了以上就是本节课程的所有内容了在今天,我们主要接触了WebUI中的Embedding 磁嵌入模型了解了它在生图过程中可以给我们带来的帮助其中,我们重点讨论了Embedding在消除负面影响上的应用
2:37:38学完以后,你应该知道如何利用Embedding给你的生图工作添砖加瓦了吧为了验证你是否真正学会了这节课的作业便是使用我们下载下来的这一系列Embedding中的任意一个完成一张图片的生成可以是针对某种风格或概念的展现也可以是利用负面嵌入优化画面质量的结果
2:37:56我会建议你在同时生成一张不使用Embedding的图片作为对比组上传来为大家展现Embedding能实现的效果但不得不提的一点是在塑造正面的形象和概念方面Embedding的效果还是有些不够稳定的而在即将开始的下一节课里
2:38:11我们会分享的 LoRa 模型会是一种公认更为强大的解决方案也是目前许多 AI 生徒玩家的主要选择你想知道它和 Embedding 有哪些不同又该如何去使用吗如果你还能学就跟着我开始新一节课程的学习吧感谢你的收听这里是 Nanny
2:38:27我们下一节课再见拜拜纵观整个Stable Diffusion的发展历程
2:38:43Lora的出现是具有重大意义的作为一种简单、低成本但效果非常好的微调形式它的出现让许多平民玩家都拥有了参与到模型训练创作中的机会并通过它们的产出极大的丰富了SD模型的生态而它使用搭配起来又相当灵活可以为基于Stable Diffusion模型的生图工作
2:38:59带来无限的可能性你想知道它的奥秘吗在这节课里我希望能在约20分钟的时间里带领你熟悉它的基本使用方式和配置细节并通过一系列实际运用LORA进行生存的案例向你剖析LORA模型在不同方向上的应用准备好,让我们开始今天这节课的确信内容吧LORA的全称是Low Rank Adaptation Model
2:39:17翻译成中文叫做大模型的低质适应最早在2021年,有微软的研究团队提出并应用在了他们早期的大元模型比如GPT-2,GPT-3中第一位将LORA引入扩散模型训练并辅助图像产出的是一位叫做Clone of Simo的开发者
2:39:33在他提出这个技术之前如果你想要让Stable Diffusion的模型学会一个新概念一般只能通过微调训练一个新的大模型也就是Checkpoint来实现出图如果对大模型产出的效果不满意那就只能再训练对大模型不断地迭代微调
2:39:49但我们也说了大模型的训练要求高消耗的算力也很大整个训练过程非常耗时耗力于是在上面那篇论文的启发下他尝试着以Laura对SD模型进行了类似的微调操作结果成功了这就有了今天你所能使用到的
2:40:05这些LORA模型了你不需要了解LORA在算法和代码上面的所有构成但它大体上在做的工作是单独针对模型里最为关键的一部分参数进行微调而非全量地进行调整所以微调模型的工作一下子变得轻松了很多
2:40:20具体一点说训练大模型的最低要求是拥有12G以上的显存但训练LORA模型可能只需要8G甚至更低这使得模型的训练能够真正在一些家用机的电脑上得到实现而常规的大模型至少会占用两个G以上的存储空间但最大的Lora模型也不会超过200M
2:40:38这也大大提高它作为一个模型去分享及运动的灵活性和便利性如今你可以在模型网站上看到各种爱好者们训练出来的Lora而正是它们让今天的AI生徒变得更加富有想象力和可能性但Lora的意义并不在于取代Checkpoint
2:40:53相反它是需要和一个大的Checkpoint一起搭配使用的从而进一步实现对这个Checkpoint在某些方面的微调这个微调既有可能是帮助模型去认识一些具体的形象角色也有可能是帮助模型拓展某一种风格艺术流派的你会在这节课的相关讲解里
2:41:10体会到这些东西落实到具体生成里的形态在WebUI里我们要如何去使用一个Lora呢基本的方式我们上上节课里也已经提到过了在将Lora模型下载下来并置入到Lora文件夹里以后同样是通过这个附加网络菜单可以读取到
2:41:25点一下就可以把Lora加入到生成里和Embedding不太一样的一点是Embedding只需要直接输入文件名就可以了而Lora需要将文件名装在这样的一个结构里左右侧的肩扩号加一个Lora冒号是Web UI用于识别Lora模型的特征符号
2:41:41如果你记得你的Lora名字那当然可以直接手敲一个这样的格式输进来下载到本地的Lora文件是可以随意重命名的但考虑到对在线参数附现的需求我们一般也不会去更改它的名字如果需要容易辨认那可以通过菜单里的封面和备注来实现
2:41:57后面跟着的冒号加数字的结构则代表着Lora模型的权重没错你同样可以给你的Lora模型赋予一个权重数值来调节它作用于你生成的强弱和提示词一样默认的数值是1.0小于1会让它变弱而大于1则会让它的作用增强
2:42:14大部分Lora在训练出炉的时候默认能发挥最佳效果的权重一般都在1.0附近但不排除有一些模型在训练时拟合程度较高学习了一些我们不想让它学进去的东西从而影响到模型本来的画风质感当你碰到了这种情况的时候
2:42:30则可以考虑适当降低一点点权重在不影响核心特征呈现的同时减弱它对于其他部分的影响这就是在VUI里使用Lora模型的基本方式了很简单对吧其实单从使用的流程上来说它一点也不难但问题来了
2:42:46在生图的过程中我们又有哪些操作是可以让Lora来帮忙的呢市面上有这么多Lora我们又要如何去做选择其实Lora是非常万能的你几乎可以使用它向你的作品里植入任何一种你想让AI生成的概念
2:43:01根据市面上Lora训练者们的产出与使用者们的下载偏好我将目前大家所能接触到的Lora主要划分成了如下几个大类包括人物角色、风格、概念以及功能性的Lora它们就代表了现在Lora的一些主要应用方向
2:43:16在每个方向上我也跳出了几个比较典型的应用实例向你说明Lora使用过程中的一些技术细节看完以后,你就知道LORA对你而言到底是一个多么有用的工具了在LORA的所有用途里,最为广泛的一个可能是针对人物、角色或IP形象的固定
2:43:33从Stable Division在二次元爱好者的圈子里流行起来开始就有许多玩家致力于将自己喜欢的角色IP训练成LORA模型并基于这个模型做一些富有欣赏价值的二创在今天,各种模型网站上的基于特定动漫游戏人物角色训练的LORA
2:43:49也可谓数不胜数这里面有你喜欢的角色吗在上节课里我们使用马奇马的embedding在SD生成的图片里还原了他的人物形象在Lora被发明出来以后也有一些模型训练者训练了他的Lora像这个Lora只需要在你的作品里加入他
2:44:06就可以让他还原出一个活灵活现的马奇马的形象在使用一个Lora的过程中你同样需要自己阅读作者写在主页里的一些说明而Lora可能有一些相关的触发词是可以用来增强生成效果的例如这个Lora可以搭配上这个带有马奇马和电锯人作品名字的提示词
2:44:24有助于更好的让他识别到这个人物元素而在作者提供的力图里你可以看到他对人物的发色衣着等部分也做了比较详尽的描写如果想要更好的还原人物特点你可以考虑把这些部分也给抄下来放到你的提示词里点生成
2:44:39看最终输出的图片就会带有这个角色身上的一系列形象特征了如果你把他和上一节课里针对同一个角色训练的embedding生成的结果做个对比你也会发现Lora很多时候对人物身上的一系列特征的复现效果会更好一些在多种不同的场景里去进行生成也会更加稳定
2:44:57也因此比起Embedding现在Lora其实是一种被大家使用的更为广泛的微调形式但它和Embedding在使用上也不冲突例如你可以在使用一个针对这个角色的Lora时再加入一个这个角色的Embedding甚至再加上几个用于优化质量的负面嵌入
2:45:12生成出来的人物效果还会更好Lora模型很重要的一个特点是它的灵活性GTT现在你可以把这个LORA和任意一个大模型搭配在一起使用并通过不同的组合实现不同的效果例如这里我们把大模型换成一个真实系风格的
2:45:28你就会得到一个真人版的马奇玛再换成了一个2.5D的Rap Animated角色就变成2.5D风格的了还挺有趣的吧而通过这个LORA我们不仅仅能做到还原还能改变人物的动作服饰甚至是所处的环境场景
2:45:43例如这里我们在后面加入这样一顿补充描述你就可以得到一张他在夜晚的城市街头抬起手轻抚头发的插画作品了因为我们的Laura在训练是固定的支持人物的形象所以只要撰写合适的提示词你就可以让他以任何一种方式
2:45:59在你的作品中被呈现出来进一步拓展如果你手里有一个原创的IP形象你也可以用类似的方式为他训练出一个Laura来从而实现IP视觉呈现形式的自由Laura模型的另一大应用是利用它实现画风或视觉风格的微调
2:46:15如果你使用大量的同风格作品去训练一个Lora就可以让她学会某一种特定艺术风格或者视觉呈现形式在之前我们讨论生成不同风格作品的形式主要是通过使用不同风格的大模型来实现的但大模型的画风往往涵盖的范围也比较广
2:46:31而Lora就能在这些粗略区分的大类下面再做细致的微调最终让生成出来的作品拥有一个更独特的细分领域风格例如我们上上节课使用过的那个盲盒Lora它在风格上可能属于2.5D类型的但光靠典型的2.5D风格大模型
2:46:48其实还挺难制作出来的此时我们就可以额外再使用一小部分这种类型的图片训练一个专门生成这种风格的Lora再和这些2.5D的模型一起去使用那想要实现这种风格的难度就大大降低了我们直接在刚才这张作品上
2:47:03再接着尝试把芒和Lora也加进来并把它的出发词配套提示词也都输入进来多个Lora能不能一起使用呢当然也是可以的点生成看你就会得到一个Q版娃娃风格的马戚马这里面一个Lora用来呈现人物特征另一个则负责整体的风格塑造
2:47:20互不冲突也相得益彰这就是风格Lora能起到的作用了需要注意的一点是同一个Lora在不同大模型上的使用所呈现出来的效果可能也是有差异的例如这个案例我们使用的大模型是Reveni Maiden它和这个盲盒Lora搭配到一起
2:47:36生成的结果才是这种可爱的盲盒手办风格但如果换成一些纯二次元类的模型或者是真实系的模型得到的结果就变得很不一样了哪怕是同属2.5D这个大类型的Gene Shaper都做不出这种我们想要的质地来为什么会这样呢?
2:47:52其实每一个LORA在训练的时候也都是要选择一个Checkpoint作为基底模型的我们也把这个Checkpoint称为LORA的底模理论上,一个LORA只有在它的原始底模上才能发挥出最好的效果但由于前面我们提到的微调训练和融合技术的存在
2:48:08大部分同类型的checkpoint其实都具备着一部分类似的血统也因此这些Lora往往也能在同类型的checkpoint上都取得还不错的效果此外有一部分训练者也会选择使用SD1.5的官方模型或Nova AI这类原始的模型作为底膜
2:48:23来保证训练出来的Lora可以拥有最大程度的泛用性不过如果Lora模型的作者有明确提到这个Lora是基于某一个底膜去训练的那最好选用它作为你出土的checkpoint或是在你的模型库存里选择尽可能和这个chip point相近的模型去搭配
2:48:40Lora能实现的风格还有很多例如这个叫做Ghibli style的Lora致力于实现的就是创作过天空之城、龙猫等经典作品的日本著名动画工作室吉卜力的风格同样,你可以在任何一种生图工作的操作里加入这个Lora上一个案例,我们正在通过图生图
2:48:57将这张图片转换成具有东南风格色彩的插画作品这里,我们已经根据图片内容正写了合适的提示词选用的大模型是二次元风格的MetaMix可以看到直接图像图的结果是这样的此时我们打开附加网络菜单将这个吉卜力风格加进来
2:49:13它的出发词就是这个Ghibli Style所以我们也要把它复制下来粘贴在后面看上传的结果就变得非常吉卜力了简直像是宫崎骏作品里截出来的图一样还有很多画风Lora他们也是如此基于不同艺术家作品的概念来做训练
2:49:28从而能最原本的将这些艺术风格的精髓保存下来而这个所谓的风格也不仅仅局限于艺术作品这里我们来介绍另外一个Lora它可以将你生成的所有正式风格的照片都变成像这样具有独特复古质感的Pelid照片这个Lora明显更适合和真实系的模型搭配使用
2:49:46看,原来生成的图片是这样的在我们加入了这个Pelid Lora以后它的质感一下子也变了在使用Lora的时候高分辨率修复也是可以开启的这样你就可以得到一张更清晰的具有独特风格的Pelid照片了在应用风格类Lora时
2:50:02权重的调节有些时候可以为你的作品赋予更多有趣的变数从这两个模型在不同权重下的对比你都可以发现权重越低生成的结果就会越接近原CheckPoint生成的质感而随着权重提高到1生成作品的风格就会越接近Lora所塑造的模样
2:50:18而在中间任意权重上取得的结果就可以看作是原模型风格和Lora风格的一种混合状态所以在使用一个风格Lora时你可以尽情尝试在不同权重下得到的结果并选择让你最反应的那一个除了塑造IP形象和风格的Lora
2:50:34在Stable Diffusion里还有许多Lora可以用于在作品中植入某种特定元素我们把这些Lora统称为是概念式的Lora例如头发虽然我们可以通过提示词非常高效地修改画面中的人物发型但能修改的一般仅限于一些常见的发型
2:50:50而这个发型Lora训练的就是一个不那么常见的嘻哈流行文化中的脏变发型但对于这类包含特定元素的Lora而言直接使用它纹身图可能会在一定程度上干扰原本大模型能正常产出的画面像这个例子里你会发现带有脏变的人物身后的背景总是比较有街头范儿的
2:51:09和原来的模型所能生成的效果差别非常大不过嘛有一种处理的思路可以帮助你避免Lora对群聚内容的干扰就是举步重绘啦在举步重绘的时候Lora也是可以发挥作用的比如这里我们涂抹选中人物的头发区域和旁边的一部分背景
2:51:25再往T4次里加入Lora和触发词重汇一下照片里的人物立刻就披上了一头酷炫的脏便而照片的其他部分都保持着原模型生成的质感这个小妙招你学会了吗再例如服饰像这个Lora训练的就是我们中国的
2:51:41传统汉服服饰我们同样以类似的操作编辑这张图片原来画面里的女生穿着的是非常富有现代感的皮衣外套我们只需稍以涂抹再把Lora和对应的出发词安排到提示词里重汇一下你就能让这位外国女孩
2:51:56穿上古典汉服了这些包含了具体概念元素的Lora其实都是在大量包含了这一元素图片的基础上训练出来的所以当你想要在画面展现一些具体的元素却无法很有效地通过提示次来实现的时候不妨去搜一搜找一找
2:52:12看看有没有符合需要的Lora说不定可以通过Lora来为你实现像刚才展示的这两个Lora在主页里还有很多次生版本像这里每一种不同的发型都被这位作者训练成了一个单独的Lora而汉服LORA的作者更是把不同朝代的服饰风格
2:52:28都给囊括进了这一个LORA里并设置了不同的出发词可以去分别调用还有很多你可能从未设想过的LORA形式例如之旅打造高端电商拍摄场景的LORA专门拥有绘制logo的LORA都是采用类似的方式训练出来的
2:52:43如果你感兴趣那可以都下载下来试用一下并尝试着拿不同的大模型提示词来和它进行一下化学反应看看能生成出什么样有趣的东西吧在这些所有的Lora里面还有一类Lora是最为特殊的我把它称为功能性的Lora
2:52:59严格意义来说这种功能性也可以是做概念的一种但它的使用范围并不局限于某一种特定的题材应该说几乎任何一种题材都可以用到这些功能性的Lora例如这个细节调整Lora它应该是SD 1.5版本里最知名的Lora之一
2:53:15因为它有一种非常神奇的作用就是可以让你的作品细节变得更饱满我们在实际生存中来体验一下吧像生成的这一幅全身人像的插画作品它整体的构图蛮合适的但细节好像少了一点此时我们可以把这个细节调整Lora加进来
2:53:32按摩人的群众1设置它没有什么额外的出发词所以直接点击生成就好了看画面的整体结构并没有太大的变化但人物的衣服身体上的细节变得丰富了很多清晰可见的褶皱让画面的立体感变得更强了
2:53:47连背景的场景都变得更加细致了这就是这个Lora能发挥的神器功效了它不仅可以在这种二次元风格的模型上发挥效果在真实系2.5D的模型上产生的作用都是相当不错的它采用了一种叫做差异训练法的方式
2:54:02通过相似但细节水平不同的图片来对模型进行训练从而使得模型能够理解这里面的差异并反馈到生成里因此加上它的图片细节水平一般都会变得更加丰满从而显得更加清晰细致所以它被广泛地应用在了各种生成实践里
2:54:20在高分辨率修复、放大等过程中加上往往也会让图片的质量变得更高更神奇的一点在于它不光可以被用于增加细节还可以用来减少细节此时如果你将提示词里的Lora群众修改为-1那你会发现画面上的细节反而变得更少了
2:54:37整幅作品的质感就更接近于那种平图的插画风格了对于这个Lora来说在正2到负2的群众上调节你都可以看到它给画面带来的不同影响不过通过这个Lora增加的细节不完全是有益的你会看到画面有很多小部分都发生了变化
2:54:54这些变化最有可能会造成一些逻辑上的不合理进而损坏画面也因此我会更推荐你在小于1的比较温和的群众上使用在实际应用时也应该多做对比去取舍和它很像的另一个Lora在真实系的模型里非常受欢迎
2:55:09它会给画面添加上这样的富有胶片电影感的噪点并营造这种高对比的冷峻实时感风格同样它可以通过权重来控制效果降弱如果你喜欢也可以下载到你的web ui里试一试这些所谓的细节和噪点其实也可以算是一种独特的风格
2:55:27那怎么说其实风格和概念之间也是没有绝对的分界线的在我的心目中其实LORA本质上就是一种帮助我们实现一些额外效果的工具你最终能实现什么取决于你给LORA喂养了什么来进行训练所以学会使用这些LORA
2:55:43也仅仅是你接触这门技术的第一步而学会了如何训练LORA你才能在真正意义上掌握这项强大的工具并利用它加持你的AI创作之路在未来的相关课程里我们或许有机会对里面的更多技术细节做讨论在那之前
2:55:58不妨先带着这节课里学习到的有关于Lora的知识在更多的时间应用里加深对她的理解吧以上就是本节课程的所有教学内容了来做一个总结在今天这一节课里我们系统将解了WebUI里与Lora的应用有关的知识并介绍了Lora的
2:56:13几种主流应用思路包括利用Lora塑造角色IP实现风格迁移向作品中植入概念以及发挥一些诸如增强细节之类的功能性的作用学到这里你应该知道该如何使用Lora模型了吧对于初学者而言了解Lora的作用原理
2:56:29并掌握它的常见应用方式是AI生图方面的选品登堂入室的一个重要标志你或许也已经猜到这节课的作业了请根据所学的知识使用任意这节课内提到的Lora模型在SampleDiffusion Web UI中生成或编辑一张图片
2:56:44在这个过程中你可以尽情使用前面几节课里学习到的包括图生图放大重绘等手法来提高作品的质量或是让Lora的效用得到更好的发挥在顺利完成了这节课以后也要恭喜你正式结束了这门课程第一阶段的学习内容
2:56:59这代表着你已经完整且系统地掌握了Stable Diffusion Web UI的绝大多数原生功能了然而正如我们一开始所介绍的一样SD Web UI的真正厉害之处在于它通过海量的扩展应用支撑起来的一个庞大而发达的功能体系
2:57:15而这便是我们在接下来的第二部分里会去一点点揭开帷幕的在马上开始的下一节课里你将解锁WebUI中和扩展插件有关的一些功能学习到如何为你的WebUI安装并配置这些功能向它的扩展插件为接下来的进一步探索打好基础
2:57:31感谢你的收听这里是Nelly我们下期课见了拜拜
| 钩子原话 | 「还把 AI 只当聊天工具?那你真的亏大了。懂行的人早已经靠 AI 把效率差变成赚钱差」——指责式提问 + 一句对仗,8 秒制造完信息差焦虑。 |
|---|---|
| 结构骨架 | 0-8s 指责式钩子+「效率差=赚钱差」的对仗句 8-24s 交付承诺:七个玩法,覆盖高需服务/跨境变现/虚拟资产,普通人零经验也能上手 25-181s 七法逐条,每条固定五要素:编号+名字 → 一句话定位 → 面向谁 → 怎么用 AI 做 → 具体金额(代运营包月 3000 元/个、老照片修复一单几十到上百、跨境一条爆款顶国内 10 条) 182-208s 收尾三连:稀缺性(「2026 是普通人靠 AI 低成本逆袭的最后窗口期」)→ 打消门槛(不用懂硬核技术、不用投一分本金)→ 二选一逼单 |
| 成交动作 | 第七法就是它自己的商业模式自白:「把任一个跑通的 AI 变现玩法整理成实操 SOP、工具清单、避坑指南,做成资料或课程在知识平台售卖……一次整理,反复售卖」——这条视频本身就是那套课的样品。 |
| 金句 | 「把效率差变成赚钱差」·「教人搞钱的内容永远最受欢迎,一次整理反复售卖,是最高级的变现方式」·「要么驾驭 AI 搞钱,要么被 AI 甩在身后」 |
| 可抄给 Mars | 结构是标准及格线模板,真正值得抄的只有两点:① 每条玩法都咬死一个具体金额——空泛的"提效"没人信,「一场直播多挑出 23 个该跟进的人」才有人信;② 第七法说破了这门生意的本质——你们该卖的不是工具,是把「直播复盘 SOP」做成可反复交付的东西,而 Mars 正是它的自动化版本。⚠️「最后窗口期」「要么…要么…」是制造焦虑的逼单话术,你们的合规纪律不能这么写。 |
00:00还把AI只当聊天工具 那你真的亏大了BP懂行的人早已经靠AI把效率差变成赚钱差让耗时的副业 小生意成了轻量易操作的现金流项目这七个玩法覆盖高需服务 跨境变现 虚拟资产等赛道
00:17普通人零经验也能上手核心就是用AI省时间提效率 把精力放在对接需求上一AI自媒体代运营一人顶一个编导团队实体店老板小品牌方都想做线上IP缺缺内容
00:34用AI爆款脚本工具投位同赛道爆款内容一分钟生成10条高原创门案借账号包月运营3000元每个半天搞定一个月内容多接多赚全程线上操作超轻松二AI时光修复师
00:50做情绪生意低成本高回报用AI修复扩图动态生成功能帮客户修模糊老照片做静态图动态效果赚的是回忆的情绪钱闲鱼小红书挂链接一单几十到上百
01:06成本几乎为零客户基本不还价复购转介少超多三AI职场校园刚需服务精准拿捏付费需求瞄准大学生作业PPT简历优化打工人汇报方案撰写的刚需
01:22用AI工具一键生成高质量内容简单优化后对外服务这类人群付费意愿拉满小单积少成多收入超可观4.AI虚拟资产创作一次制作胖赚常为收益
01:37用AI生成国风二次元头像壁纸表情包等虚拟资产表情包传微信平台赚打赏头像壁纸做账号引流卖源图单价随地但是一次制作长期赚钱后期基本躺赚
01:53长尾效应拉满5. AI跨境内容变现赚汇率加流量差降维打击把国内抖音爆款短剧解压视频用AI工具一键翻译配对口型发到TikTok YouTube国外流量分成比国内高几倍
02:10再加汇率差一条爆款收益顶国内10条低门槛做跨境生意6. AI亲子内容变现瞄准家长赚吞金受了钱家长永远愿意为孩子买单用AI写儿童预言睡前故事
02:28搭配AI插画要么剪短动画发中视频赚流量要么做成电子绘本上架亚马逊售卖多平台布局赚双份刚需收益七AI实操方法论售卖做赛道卖产人最暴力长久
02:45把任一个跑通的AI变现玩法整理成实操SOP工具清单避坑指南做成资料或课程在知识平台售卖教人搞钱的内容永远最受欢迎一次整理反复售卖是最高级的变现方式
03:02我觉得2026年就是普通人靠AI低成本逆袭的最后窗口期这七个玩法没有任何高门槛不用你懂硬核技术不用你投一分本金只要你肯放下观望立刻行动把AI的效率变成自己的赚钱能力
03:18就能甩开那些还在把AI当玩具的人快速赚到第一桶金别再等别再拖要么驾驭AI搞钱要么被AI甩在身后这就是最真实的现实
| 钩子原话 | 「从今年开始,知识付费和知识服务都要退居二线了。因为这两类知识产品会被一个新的形态全面取代——叫卖无数个自己」——断言行业变天 + 抛一个没人听过的新名词。 |
|---|---|
| 结构骨架 | 0-12s 断言式钩子:行业要变天 + 新名词「卖无数个自己」=知识库智能体 + 答疑社群 12-16s 预判杠精:「大家先别着急杠,我给大家解释一下为什么」——把反对者留在评论区而不是划走 16-35s 拆旧模式卡点一:卖课是单向输入,90% 的人完不成,实践中遇到问题老师帮不上 35-45s 拆卡点二:转做知识服务/陪跑能及时响应,但交付成本太重 45-65s 给唯一解法:要同时解决这两点,就得把静态单向输入变成实时双向互动,还要把老师复刻成无数份——只有智能体能干 65-80s 重新定义社群:不再是留作业批作业,唯一目的是答疑——AI 出幻觉时老师站出来,因为 90% 的活 AI 已经干完 80-85s 拔高到理论:本质是回归古代学徒制(实时纠正、共同工作),而不是工业时代的标准化灌输 85-89s 举证+收尾金句:某博主起号三个月卖出 4000 多份知识库 |
| 成交动作 | 无挂车、无报价。它卖的是认知位阶——听完会觉得这个人站得比所有卖课的高一层,这本身就是他的产品。 |
| 金句 | 「卖无数个自己」·「未来 AI 人公司的优势,并不是用 AI 去做 AI 做不到的事,而是用 AI 去做你能想到的事」·「知识付费并没有过时,它只是换了一种形态」 |
| 可抄给 Mars | 全库叙事位阶最高的一条,而且和 Mars 撞了个正着——你们卖的不是教程、不是工具,是一套跑起来的关系资产系统。四段式可以直接平移:断言行业要变 → 拆旧模式的两个卡点 → 给出唯一解法 → 用一个真实战绩举证。⚠️ 他举证用的是转述别人的数字,你们举证必须用自己可验证的数据(付费专题复盘里现成)。 |
00:00从今年开始 知识付费和知识服务都要退居二线了因为这两类知识产品会被一个新的形态全面取代叫卖无数个自己 也就是知识库智能体加达仪社群大家先别着急杠 我给大家解释一下为什么首先卖课的卡点是什么是90%人都没有办法完成课程 是单项输入
00:18如果学生在实践中遇到问题 老师没有办法帮他解决问题所以很多人开始转型做知识服务 陪跑什么的但是卖服务的问题是 虽然老师可以做到及时响应但是对于老师来说 交付成本又太重要同时解决上面这两个问题
00:33那就必须要把静态的单项输入变成及时的双项互动同时能把老师复刻成无数份那这个事也就只有智能体 也就是老师的AI分身能干就是把老师的知识灌输到智能体里 让学员可以随时调用那为什么还要卖社群呢这个时候社群的目的就不是像以前那样留作业 批改作业
00:51分享一些创业心得什么的它唯一的目的就是答疑 是当AI出现幻觉的时候老师能及时站出来这对老师来说只是很小的一部分工作量因为90%的工作AI已经完成了你会发现这本质上是回归了古代的学徒制
01:07叫实时纠正共同工作 也就是传邦贷它不是迈克那种工业化时代标准化灌输大家看一下这个博主他起号才三个月 目前已经卖出去了4000多份知识库了所以未来艺人公司的优势并不是说做AI做不到的事情是用AI去做你能想到的事情
01:24所以知识付费其实并没有过时它只是换了一种形态而已所以未来艺人公司的优势并不是说做AI做不到的事情抖音
| 钩子原话 | 「我实在看不下去不用 AI 的人了,我今天要用 AI 帮你们挣钱、帮你们省事」——带情绪的"看不下去"式开场,逼观众自我归类。 |
|---|---|
| 结构骨架 | 0-15s 情绪开场+承诺:五个工具,不用装任何智能体,完全零入门,看完直接用 15-60s 工具① 口播剪辑:拍段口播导进去一键生成有网感的成片;加码数字人模式「你连讲都不想讲也可以」→ 收在卖货、卖服务、卖课程 60-95s 工具② 做 PPT:语音说需求 → 生成大纲 → 一键转 PPT 并指定风格;用「以前要做半天,现在 10-20 分钟」量化收益 95-115s 工具③ 语音转提示词:写提示词太麻烦,改成发语音自动转成有逻辑的文字(自动分段、自动加标点、自动去口头禅) 115-135s 工具④ AI 音乐/BGM:说清风格用途,一键生成 135-138s 收尾:全部一键、傻瓜式使用 |
| 成交动作 | 无挂车、无报价——它是达人安利位。真正的信号是:头部带货主播已经开始把 AI 工具当选品讲了。 |
| 金句 | 「我实在看不下去不用 AI 的人了」·「零入门,看完直接用」·「AI 时代,我张沫凡五音不全竟然能写歌了」 |
| 可抄给 Mars | ① 每个功能都必须落到"能帮你卖什么"——她讲剪辑一定收在"卖货卖服务卖课程",Mars 讲星图也要收在"多成交几单";② 「不用装智能体 / 零入门 / 傻瓜式」是普通用户最吃的词,写进文案;③ 真正的机会是找这类达人做分发:她一条安利 1 万赞、6725 收藏,一次合作抵自己发十条。 |
00:00我实在看不下去不用AI的人了我今天要用AI帮你们挣钱 帮你们省事帮你们在工作上 生活上然后都大声一句给你们分享我自己用下来的五个工具不用安任何的智能体甚至你可以完全不太会用AI全部零入门 看完直接用的东西第一个叫做开就现在大家都知道是这个短视频时代
00:16就很多人都会发一些短视频但是基于很多人它虽然很有知识 很有文化它可以输出很多内容但是它不会剪辑所以大家都基本就死在这一步那这个软件叫什么就是开我们就拍一个口播然后给它导进去你看它一键就可以生成这种非常有意思非常有网感的口播视频这样以后你口播就再也不愁了真的很适合那种
00:31比如你要卖服务也好或者你想你拥有一些不一样的知识你想讲出来的人那如果说你连讲都不想讲也可以帮你它里面有一个数字人模式你可以直接生成一个数字人让这个数字人去讲反正你最终也是为了卖服务所以你用这个数字人其实你可以拿来卖货卖服务 卖课程一切都可以还有什么理由不行动
00:46姐妹们咱们就一天生成五条视频咱们就发第二种什么工作场景非常需要就是怎么做PPT特别麻烦这个做PPT我让我男朋友试了我跟你说在某款线市场让我跟你没少挣钱就是我们现在生成PPT可以用两个一个扣打一个诸特别麻烦还有一个就是诸特一点都不麻烦然后它生成PPT有多简单就以前你生成PPT
01:02你得写文案吧你也就设计吧现在完全不需要了你先把这些你想做的事情用语音的模式全部记录下来你就发给我然后你就提示则如下根据我这段语音你帮我生成一份PPT大纲之后直接转到PPT模式一键生成PPT甚至你还可以告诉他你想要的风格
01:17所以就非常的简单根本就不需要按什么Skill什么的总而言之就是做一个PPT也真的以前可能要做半天现在也就10分钟20分钟咱就能做成第三个我觉得不好使我们要跟这个AI说话我们需要提示词提示词越好它越能理解你的需求但是你有没有想过写提示词真的很麻烦因为你要有逻辑你要想的特别周全那如果你发语音的话
01:34会不会更好这个时候我就推荐你用这两个软件它们俩都是可以把你很索罪的话然后转变成有逻辑的文字包括我手机手机现在都在用这个豆包输入法真的是嘎嘎好使自动分段自动加标点自动去口头谈我现在真的基本不会打字我的效率直接分了三位你知道吗下一个就是如果有的时候我们需要做一些音乐
01:49或者做一些BGM然后研究一些什么最高原创类型的音乐你可以用的这个可能是什么音乐制作人或者什么搞音乐的他可能看不上但是对于我们来说我们太喜欢了比如说你可以跟他说我想要轻快一点的音乐我想做产品展示然后我是卖什么东西的我想生成一段什么音乐我跟你说也是一键生成
02:04我的妈呀谁敢想要AI时代我张莫凡五音不全竟然能写歌了开心好了今天就是这些全部都是你一键就能使用傻瓜是使用啊
| 钩子原话 | 无口播。同一账号的同系列另一条,靠标题梗:「2026 活全被 AI 干了,我只能摸鱼了」。 |
|---|---|
| 结构骨架 | 与 ⑪ 完全同构:5 秒、一句反差梗、一屏截图。同一个梗打两次,一条 3.4 万赞、一条 7712 赞。 |
| 成交动作 | 无。系列化本身就是转化——观众记住的是"这个号专门讲 AI 怎么替我干活"。 |
| 金句 | 「活全被 AI 干了,我只能摸鱼了」 |
| 可抄给 Mars | 把「记性最好的助理」当成固定梗做成系列,一周三条、每条 5 秒,梗不变、场景换(记住客户生日 / 记住谁答应过要来 / 记住三个月前那句吐槽)。同一个梗打透,比每条都换新梗有效。 |
开场句型可再用 /hook 按24句型库出备选;标题/发布文案用 /title 出四流派;此脚本已内嵌"具体数字+悬念+演示即证据+评论饵"四要素。
| 环节 | 动作 | 对标依据 |
|---|---|---|
| 账号分工 | 主号(风哥/清风人设)讲方法论与案例;企业号/小号挂组件、发促单短视频 | 影视飓风 主号+旗舰店 双账号(①②) |
| 内容节奏 | 周1条主打(框架A/C,1-2分钟)+ 周2-3条引流(框架B、5-30秒梗/清单)+ 每次发版1条迭代视频 | ③售后内容化;⑪系列梗 |
| 承接 | 评论区置顶+私信关键词(扣"星图"送免费复盘样例)→ 官网试用;≥$20/月订阅走「免费复盘一场→看到自己的星图→付费」的体验路径 | ④"方法全公开"慷慨感;⑮免费引流课模型 |
| 直播承接 | 直播现场实时跑 Mars 分析本场弹幕,观众亲眼看自己变成星图节点——演示即成交,这是软件独有的直播玩法 | 软件演示类可行性(⑫) |
| 叙事位阶 | 不说"卖工具/卖课",说"卖系统":一套跑着的关系资产系统 | ⑰行业风向 |
| 风险纪律 | 只做效率工具叙事,禁"AI伴侣/陪伴"表达;价格与承诺留在私域/官网,避免"无限""包赚"类绝对化用语 | 7·15新规;豆包"无限畅聊"虚假宣传争议 |
抖音采集:9223 登录态 Chrome,搜索页 ?type=video&sort_type=1(点赞排序),登录墙 reload 一次;8关键词×~30卡片=240条,去重237条,成交型信号打分(课程/报名/训练营/变现/软件/工具/AI 等词加权)筛49条,人工复核19条;精确发布时间来自登录态视频页。互动数据(赞/评论/收藏/转发)为 2026-07-28 分享接口精确口径;原片由分享接口下载,音轨经 ffmpeg 抽取后用 mlx-whisper large-v3(中文 + AI/知识付费领域提示词)转写,转写按 15 秒合并分段并保留时间码。
模型盘点来源:
新浪·2026国产大模型排行 ·
每经·2026Q1 AI应用价值榜 ·
36氪·五款国产AI App实测 ·
知乎·国内外知名大模型及应用(2026/07/17) ·
AI Tool CN·国产大模型场景对比
产品信息:marsdata.ai 官网公开页面(2026-07-25抓取)。
生成:Mars_agent · Claude · 2026-07-25