RTX 40系显卡 MFG 解锁 继续更新ing
本帖最后由 ft5555 于 2026-9-5 14:18 编辑RTX 40系显卡 MFG 解锁现在基本就是两个作者matiasLombo与Dashdogy在各自的线路上优化改善。
==========================
先分享一个discord社区里以Dashdogy版本为基础的更易用版,Dashdogy这位学生作者亲自参与github reddit discord nexusmods4个地方的发布与讨论,所以他目前人气比较高,各种变种版本也多。
变更日志 v1.3.1
修复了模组的配置保存/创建部分。
Ctrl + Alt + Up / + :将 DMFG 目标 FPS 提高 +5 FPS(最大 1000 FPS)。
Ctrl + Alt + Down / - :将 DMFG 目标 FPS 降低 -5 FPS(最少 30 FPS)。
按住 Shift(Ctrl + Alt + Shift + 向上/向下)可调整 ±1 FPS(非常适合精确的 G-Sync 上限,例如 144 Hz 上的 141 FPS)。
调整目标 FPS 会自动切换到动态模式并更新游戏中的节奏,而无需重新启动。
自动将新目标保存到 DLSSG-Transfusion.json。
添加了配置文件防护:传输严格限制为 DLSS-G 310.9+ 上的 Kernel_EstimateIntermMvecsScatter
从独立游戏中删除:bridge_status.json
注意事项:
Ctrl + Alt + 2..6 应该更改乘数
如果您有其他 mod 的 config.json,请先将其删除。仅使用 zip 中的 dll(仅选择适合您的一个),并且不要重命名它们。
如果与 optiscaler 一起使用,请确保它不会覆盖翻转计量标志,在 optiscaler 配置中禁用它,对我来说,它在没有翻转计量的情况下效果更好。此外,optiscaler 将覆盖乘数,在其界面中使用 override dlssgratio 来更改它。
测试使用:DLSS 310.9/8 sl 2.14/13
由于名称更改,建议删除旧名称配置和日志
学分:
Dashdogy 原始模组
mavismmg 用于简化天花板开盖和拱门旁路
变更日志 v1.3
Blackwell 内核传输(sm_120 到 sm_89,仅 Kernel_EstimateIntermMvecsScatter)
可以使用“blackwellTransfusion”进行切换:配置中的 true
可能是相同的/安慰剂,我会让你决定。
注意事项:
Ctrl + Alt + 2..6 应该更改乘数
如果您有其他 mod 的 config.json,请先将其删除。仅使用 zip 中的 dll(仅选择适合您的一个),并且不要重命名它们。
如果与 optiscaler 一起使用,请确保它不会覆盖翻转计量标志,在 optiscaler 配置中禁用它,对我来说,它在没有翻转计量的情况下效果更好。此外,optiscaler 将覆盖乘数,在其界面中使用 override dlssgratio 来更改它。
测试使用:DLSS 310.9/8 sl 2.14/13
================================
matiasLombo比较低调,只有github。但他会在这里分享自己的研发过程,看看挺有意思的。
https://github.com/matiasLombo/mfg-unlock
v1.2 — 打造 4 倍流体的内核
只需将文件version.dll放入游戏文件夹即可。无需其他操作——无需添加任何文本文件,无需
替换任何 DLL 文件,也无需更改任何设置。
发生了什么变化
Blackwell 帧生成内核现在默认安装,正是它们
使得 3x/4x 真正看起来像 3x/4x。
它们在之前的版本中就存在,但需要通过一个几乎没人创建的启用文件才能启用
,并且在源代码中被描述为“速度变化,而非图像变化”。
这种说法从未得到验证,而且是错误的。《阿凡达:潘多拉前线》在4
倍速下,镜头移动时会出现卡顿,而启用后则非常流畅,
其他所有设置都完全相同——相同的版本、相同的代码片段、相同的设置。关键在于
运动矢量估计,它与症状完全吻合:
静止时画面看起来正常,但镜头移动时就会出现卡顿。
如果你之前尝试过 3x/4x 版本,感觉和 2x 版本一样不流畅,那么这次的版本值得你
再次尝试。
覆盖范围。内核会根据 DLSS-G 代码片段的构建进行重建,并且
现在头部会同时包含多个内核片段,这些片段会在加载时根据指纹进行选择。
涵盖整个多帧时代(310.1 至 310.9)的 14 个代码片段最终
只使用了三种内核布局;这三种布局均已发布,并且都在
实际游戏中得到了验证——分别是《阿凡达》、《赛博朋克 2077》和《侠盗猎车手 5 增强版》。
旧版 Streamline。运行 Streamline 2.7 至 2.10 的游戏(包括 Avatar)对其中
两个补丁的实现方式不同,并且之前一直没有收到任何更新。
现在,这两个补丁都已针对该版本进行了更新,并已离线验证,确保不会影响
2.11 及更高版本。
日志会告诉你, CUBINS NOT APPLIED这意味着 4 倍速运行时会出现卡顿,而不是
错过了加速。如果你看到了这条日志,说明你机器上的代码片段比
这里任何代码都新;提交一个 issue mfg-unlock.log,只需要一条命令就能
解决。
已确认正常工作
《毁灭战士:黑暗时代》、《侠盗猎车手5:增强版》、《赛博朋克2077》、《阿凡达:
潘多拉星球前线》。RTX 40系列显卡。
https://github.com/matiasLombo/mfg-unlock/releases
=================================
mfg-unlock作者写的: 摘录机翻过来,完整的在https://github.com/matiasLombo/mfg-unlock/blob/master/FINDINGS.md https://github.com/matiasLombo/mfg-unlock/blob/master/README.md
我们从拆解 DLSS-G 中学到了什么
记录了我在 Ada 语言中解锁多帧生成、找出 4x 格式显示错误的原因以及重新构建三个内核的过程。之所以写下来,是因为走弯路的成本远高于找到答案的成本。
硬件:RTX 4070 Ti(Ada,sm_89),驱动程序 616.56。游戏:DOOM The Dark Ages(Vulkan),GTA V Enhanced(D3D12)。
1. Ada 并没有运行更差的算法
显而易见的理论——4x 是为 Blackwell 设计的,而 Ada 则走的是一条较差的路线——是错误的,需要彻底拆解才能自信地得出这个结论。
整个代码片段中只有两处架构比较。两者都是cmp <reg>, 0x1B0。一处将设置DLSSG.MultiFrameCountMax为 1 或 5;另一处存储一个布尔值,该值仅允许帧计数大于 1。两者都不选择算法。
网络内核完全没有提供 Blackwell 编译版本。39个 fatbin 仅包含 compute_89PTX 文件。Ada 运行预编译的sm_89cubin 文件;Blackwell 使用 JIT 编译相同的 PTX 文件。这与 DLSS 神经渲染的情况正好相反,DLSS sm_120只提供了 DLL 文件,Ada 需要从头开始编译。
sm_86立方体和sm_89内核完全相同——指令数量相同、操作码相同、寄存器相同、共享内存相同,内核本身也完全相同。唯一的区别在于不同架构的nvdisasm拼写方式F2FP。
不支持FP8。Ada拥有而Ampere没有的那个张量特征并没有被使用;卷积运算采用的是FP16 HMMA。我们之前的神经渲染工作已经证明,在Ada上FP8和FP16的性能是等效的。
在 Ada 上生成的图像没有任何会更糟的地方。同样的权重,同样的内核,同样如此timeFactor = index / (count + 1)。
===========================
个人开启G-sync下使用感受
DLSSG-Transfusion: 输入延迟高(与mfg-unlock比鼠标旋转画面有沉重滞后感),但目前能支持5x,6x ,动态帧生成。
mfg-unlock: 输入延迟低 。目前只支持到4X,120HZ以内显示器用足够。
所以40系没有多帧生成确实是人为卡的呗 沙发沙发 发表于 2026-9-2 09:57
所以40系没有多帧生成确实是人为卡的呗
当然啊,40和50差距没有40和30那么大 和之前mod体验会有区别吗?比如延迟方面?之前就试过x3,感觉有延迟了已经,x2依然是体验最好的 50对比40最大的优势就是多倍帧和FP4了
—— 来自 Xiaomi 2304FPN6DC, Android 13, 鹅球 v3.5.99-alpha 40系本来是支持x2但不支持x3,x4,x6和动态多倍吧,实际使用最多也就x2了
—— 来自 Xiaomi 25019PNF3C, Android 16, 鹅球 v3.5.99 原先的破解mod好像帧序列/间隔有问题,最新这个好像已经解决了
Re:Source · Xiaomi 17 Pro Max ASI LOADER之前已经安装过的话是不是只要把2077的那个asi丢进去就行了 我就觉得照现在ai的水平,dlss5都是秒破,MFG应该也很快,果然这就来了 WhiteGlint 发表于 2026-9-2 16:28
ASI LOADER之前已经安装过的话是不是只要把2077的那个asi丢进去就行了
用主楼更新的nga转载那个版本吧 应该对2077以外的游戏兼容更好 40系红沙使用成功 用3x体感非常好 延迟轻微增加 BK10 发表于 2026-9-2 14:01
和之前mod体验会有区别吗?比如延迟方面?之前就试过x3,感觉有延迟了已经,x2依然是体验最好的 ...
https://github.com/matiasLombo/mfg-unlock试试这个,主楼有我的使用感受 WhiteGlint 发表于 2026-9-2 23:19
40系红沙使用成功 用3x体感非常好 延迟轻微增加
https://github.com/matiasLombo/mfg-unlock试试这个,主楼有我的使用感受 windaria 发表于 2026-9-2 11:03
当然啊,40和50差距没有40和30那么大
看了下mfg-unlock作者的开发说明
我的理解是40系破解MFG跟50系画质没有区别 ,50的PTX指令40也全有,但40系处理起来性能损失要大一些。
作者破解了帧生成数量限制,解决了画面不够平滑的问题,把算法做了移植。把50系的硬件计时交给cpu来做。
40系唯一比50系的少的就是硬件计时,但软件计时又是nv官方的 Streamline 文件里提供的。
结论:老黄想给40整上其实很简单,但就是不做。
50系和40系相比,升级了哪些特性 https://github.com/mavismmg/MFGAdaUnlock-RenoDx
renodx组也发了新的 继续更新。 话说显示器是4K 60的,开了多倍帧生成后游戏画面撕裂,有什么好办法么,如果限制帧率,60帧里面只有30帧的真实帧,操作手感又会受影响 普朗克 发表于 2026-9-5 14:55
话说显示器是4K 60的,开了多倍帧生成后游戏画面撕裂,有什么好办法么,如果限制帧率,60帧里面只有30帧的 ...
60hz确实尴尬 , 试试垂直同步选择快 。也就它了。 ft5555 发表于 2026-9-3 21:39
看了下mfg-unlock作者的开发说明
我的理解是40系破解MFG跟50系画质没有区别 ,50的PTX指令40也全有,但4 ...
交给cpu做,那对cpu性能影响大吗? 本帖最后由 BK10 于 2026-9-5 16:50 编辑
今天试过mfg-unlock 整个ui都在闪,老黄刚更新新NVAPP,没事了原来是nvapp覆盖设置忘记关了,关了就好了,之前设置了推荐帧升级,不过x3这个延迟还是明显的,不说不能玩,但是类似doom这种我还是x2吧 BK10 发表于 2026-9-5 15:58
交给cpu做,那对cpu性能影响大吗?
一般来说现在的大半部分游戏开高特效瓶颈都不在cpu 而在gpu,我7800x3d +4090 大部分游戏4K情况下 gpu占用99% 而cpu占用通常是过半甚至不到 tmmd 发表于 2026-9-5 16:38
一般来说现在的大半部分游戏开高特效瓶颈都不在cpu 而在gpu,我7800x3d +4090 大部分游戏4K情况下 gpu占 ...
这u太顶级了,没啥参考性啊 德尔惠净水器 发表于 2026-9-3 21:46
50系和40系相比,升级了哪些特性
fp4/nvfp4/mxfp4的tensor支持,更强的fp8性能。 德尔惠净水器 发表于 2026-9-3 21:46
50系和40系相比,升级了哪些特性
4090带不动6k165
论坛助手,iPad BK10 发表于 2026-9-5 16:26
今天试过mfg-unlock 整个ui都在闪,老黄刚更新新NVAPP,没事了原来是nvapp覆盖设置忘记关了,关了就好了, ...
用2077感受了下。确实倍数越高延迟感越大。不过50系也是这样的。 鬼武者能用吗 上DLSS5之后帧数不够了 30系帧生成还有救吗 现在只能用fsr3帧生成mod,很多游戏都有图像错误 临界点 发表于 2026-9-6 21:06
鬼武者能用吗 上DLSS5之后帧数不够了
有人弄了些整合包 ,反正是稍微复杂些的 得自己折腾。能用是肯定能用。 すぴぱら 发表于 2026-9-6 21:10
30系帧生成还有救吗 现在只能用fsr3帧生成mod,很多游戏都有图像错误
Not because of the gates — those are just constants. Because the DLSS 4 snippet ships no Ampere machine code. Its 70 fatbins carry PTX sm_89 ×70, PTX sm_120 ×31 and cubin sm_89 ×31, and nothing for sm_80/sm_86. PTX is forward-compatible only, so sm_89 PTX cannot be JIT-compiled down to sm_86; the module load fails outright.
Retargeting is theoretically open — the kernels use only mma.sync m16n8k16/m16n8k8 FP16 and ldmatrix, with zero instructions newer than sm_86 (no FP8, no wgmma, no TMA), and the old hardware optical-flow dependency is gone in DLSS 4. But frame generation costs roughly a fixed amount per generated frame, and Ampere has far less FP16 tensor throughput per SM, so the generation pass would likely cost more than the frame it saves. It was investigated and deliberately dropped.
社区里的解释 すぴぱら 发表于 2026-9-6 21:10
30系帧生成还有救吗 现在只能用fsr3帧生成mod,很多游戏都有图像错误
现在都用XEFG吧。
https://h.juij.fun/zh/optiscaler/
—— 来自 OnePlus PJD110, Android 16, 鹅球 v3.5.99 すぴぱら 发表于 2026-9-6 21:10
30系帧生成还有救吗 现在只能用fsr3帧生成mod,很多游戏都有图像错误
有的,有的。甚至20系的都有了
【20/30系N卡DLSS多帧生成安装教程!!!-哔哩哔哩】 https://b23.tv/tmX2IIE
github.com/sdli1995/dlssg_for_sm86 给20 30系解锁Smooth Motion吧
页:
[1]