某千年古老职业的从业者们没想到有一天自己也会失去核心竞争力
其实我一直想知道AI生成视频里面的文字要怎么保证不变形?生成不含文字的视频还好说,只要带文字的就基本必定变形
—— 来自 HUAWEI HBN-AL00, Android 12, 鹅球 v3.4.98
colice 发表于 2026-8-10 08:50
其实我一直想知道AI生成视频里面的文字要怎么保证不变形?生成不含文字的视频还好说,只要带文字的就基本必 ...
我用Krea2好像只能生成笔画简单的汉字,像骚这种字会严重变形,视频模型估计也一样。
希德尼娅 发表于 2026-8-8 10:36
配置啥?不是官方.30版本自带模板嘛,把权重拷进去就能玩了
原来如此,感谢,我是以前配置comful总不成功,不敢尝试了
colice 发表于 2026-8-10 08:50
其实我一直想知道AI生成视频里面的文字要怎么保证不变形?生成不含文字的视频还好说,只要带文字的就基本必 ...
做参考图。我基本都是单独跑一张需要文字的图,
—— 来自 S1Fun
木水风铃 发表于 2026-8-10 00:23
之前没用过C站,nsfw all in one是哪个呀?可以麻烦发下编号吗?
https://civitai.red/models/2834417/
试了下阿里云的qwen3.7flash和小米的mimo2.5都有内容审核,请问有什么平台上什么模型可以看图的+没有甲?
只要能看图就行,不用生成。(输入是图片/文字,输出是文字)
或者是必须自己部署吗?
claymorep 发表于 2026-8-10 18:00
试了下阿里云的qwen3.7flash和小米的mimo2.5都有内容审核,请问有什么平台上什么模型可以看图的+没有甲?
...
自己部署一个小模型足够了,推荐Ministral-3-3B-Instruct-2512,纯CPU都能跑,甲不厚只要不是炼铜之类的图一般都行
claymorep 发表于 2026-8-10 18:00
试了下阿里云的qwen3.7flash和小米的mimo2.5都有内容审核,请问有什么平台上什么模型可以看图的+没有甲?
...
OPENCODE+API
4分钟十秒,现在问题是分段续拍线条和色彩会偏移
实测无敌,4090爽跑;15s 大概10min不到没上加速。直接copy 小说情节到官方T2V工作流就可以了,自动识别中文。效果很惊喜。实测几乎无甲,也就是音频没办法很好的跟随剧情自动生成了。
克图格亚 发表于 2026-8-10 21:59
4分钟十秒,现在问题是分段续拍线条和色彩会偏移
分段是整个ai视频的老大难问题,只能用各种小技巧,模型层面无能为力
本帖最后由 爱吃冻鳗的猫 于 2026-8-11 09:12 编辑
有人用16G显存跑过720P吗?感觉会炸一直没试。5080+32g内存能用时间换画质吗?
我9070+32G内存都跑过.9MP 10S,4步111S一步,只要程序不崩溃就是能跑。
爱吃冻鳗的猫 发表于 2026-8-11 09:06
有人用16G显存跑过720P吗?感觉会炸一直没试。5080+32g内存能用时间换画质吗? ...
不带参考视频可以跑
5070ti笔记本也能跑;5s;4:3大概5分钟不到
这个能不能像即梦那样在提示词里@某一张图片的?要怎么写?
现在lora都是fp16训练的 是不是int8用不了啊 试了下结果全糊
龘䶛䨻䎱㸞蚮䡶 发表于 2026-8-11 21:47
这个能不能像即梦那样在提示词里@某一张图片的?要怎么写?
我是在阿b找到个文生图生多参合一的节点能这么弄,按@就能指定参考,不过试下来提示词还是得按h3标准来做,不像sora2、seedance2那样能直接大白话
https://b23.tv/yvSe8s0
qwased 发表于 2026-8-6 12:32
TE-speed-minimaxH3 加速高达45%
https://pan.quark.cn/s/9c37b6c9a778
谢了。我去看看的。
谁有把声线克隆纳入到视频生成的工作流?
怎么工作流和模型分享全是夸克网盘
有百度网盘分流吗?
5000 ada 32G + 64G内存有适合的一键整合包吗
刚刚看到minimax music也开源了
说是能生成五分钟内的音乐
格林达姆 发表于 2026-8-14 02:25
刚刚看到minimax music也开源了
说是能生成五分钟内的音乐
看了下项目介绍,必须要两块N卡,这个门槛估计把大部分人都卡出去了
zerona 发表于 2026-8-4 16:12
问下你用的是哪个工作流?我现在卡vae那块了,gpu100%
VAE用原版不要用量化的,模型选INT8参数,另外虚拟内存加大,我之前就碰到过这种问题。
本帖最后由 格林达姆 于 2026-8-14 15:54 编辑
cx_akns 发表于 2026-8-14 10:22
看了下项目介绍,必须要两块N卡,这个门槛估计把大部分人都卡出去了
试了下,单显卡也能用
就是现在只开源了文本生成,没法用音频参考搞翻唱
官方工作流的tiled decode打开,16g显存生成5分钟的完整歌曲大约十二分钟左右
本帖最后由 aimbot 于 2026-8-18 21:29 编辑
感觉这程度能开个课卖提示词和工作流了哈哈哈
感叹一下国内这个环境到处都是搞网赚盘和卖课的,想找到点有用的东西真难,到最后还是只能自己搓,说是自己搓其实也是东偷一点西偷一点
cx_akns 发表于 2026-8-14 10:22
看了下项目介绍,必须要两块N卡,这个门槛估计把大部分人都卡出去了
单a卡也是随便玩,这要求只能说是夸张了
玩了几天,我只能说有好的提示成没好的提示词,真的一个天一个地。目前最适合我这种16G显卡还是跑一个首尾帧,做几秒小视频。单纯的上传人设图跑视频上色风格会歪。