找回密码
 立即注册
搜索
查看: 1931|回复: 13

[屁股] 一次无意义的大模型专项评测及其过程中的行为审计(经营办公向)

[复制链接]
     
发表于 2026-8-14 15:38 | 显示全部楼层 |阅读模式
8月13日夜,贤者时间,无聊。

我选了一段 45 分钟、含一手信源、无字幕的专业财经长视频作为统一考题(视频内容本身不重要,以下全部隐去)。实验分四步:
第一个步骤是设立了一个初始评测对象——一个B站的视频,要求6个被评测知名国产大模型(主要来基于鹅厂wb界面,wb内置大模型有3个、外部api接入3个),对视频内容的真实性、up论据、up论点进行汇总、验证和评价(在第一个问题我就明确告知这是个测试),并追问了2个问题。各大模型在此阶段已经有明显的表现区别,主要还是在工具资源调动的积极性、推理能力上。
第二个步骤是在第一步的基础上,要求7个大模型(wb内置大模型有4个、外部api接入3个,增加了一个内置)对第一轮6位选手的表现,进行深度评价。这个时候就发现各大模型在理解意图的能力、执行意图的忠诚度、执行意图的决断力/资源调度能力上居然有了不同。一些大模型与我发生了多次对话,走捷径、借鉴/作弊的行为已经在部分大模型身上发生。
第三个步骤是我对第二个步骤中的可疑大模型进行了再次追问,这个阶段被追问的大模型似乎都做了合理解释。摆烂的继续摆烂。有1大模型(api接入,充了值的)在此处发癫、语无伦次、前后矛盾。


前三轮途径如下:




第四个步骤是最后用4个表现较好的大模型,对前三步中,各大模型的表现进行审计和评价。结论趋同。摆烂的、作弊的基本都被揪了出来。




结论:
1、大模型能力确实天差地别。
有个免费大模型多次理解意图出错、“误用”别家结论/产物;考虑其为免费且在wb的地位特殊,归为不可用。
有个wb内置大模型直接摆烂,直接“复用”“抄袭”不做申明。归为不可用。
有个才发布的知名大模型(api版)任务多次中断、理解出错。结合内置版让我非常满意的长期表现,我感觉是匆忙发布期间的技术问题,不涉及品格。会继续留用。
有个多模态知名大模型(api版)推理任务理解能力偏下,第二轮后就不再参与测试。考虑生图、生视频的小需求,会继续留用。
一半大模型在第二轮测试开始没有意识到工具调动的重要性,被提醒了才下载/复用其他大模型已经下载的产物。
2、大模型在现阶段执行长上下文任务依然存在缺陷
第一轮测试的是重要任务的推理能力和资源调度的积极性、第二轮测试主要是理解复杂意图的能力、第三轮测试主要是人机对话可信任度、第四轮是超级任务的推理能力。
综合四轮下来,多多少少都出了一些问题。
表现最好的大模型(api版),在第四轮中也为了赶时间/节约资源出现理解上的小偏差(前三轮表现可堪称完美),但作为flash版,也算我最满意的。4轮任务花费1.33。满意。
表现次好的大模型(api版),在第四轮中也出了理解和调研上的瑕疵和问题且没有自查到(而且我用内置的同版本做了复核),考虑其超高的成本(4轮任务47块含赠送,卧槽),让我不得不将其归为慎用一栏。


经验:
评测要内置"探针":高精确提示词、清晰直接的要求、在能力边界上的直接追问,很重要。绝大多数大模型调取资源能力应该大同小异,但理解力、决策力、执行力有差别,造成诚信度、结果复用上有差别。

独立任务需要"隔离":大模型一旦读过他人结论,独立性即被污染,"假装没读过"不可能——重开会话是唯一解法。尤其是对经营者结构化思考、风险评估等领域,需要诸多大模型、多对话窗口并行的,一定要注意物理隔离。
警惕"冒名":确认调用的模型身份与宣称一致——API 直调与平台内置,质量可能天差地别。wb这点还做得不错。




本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
回复

使用道具 举报

     
发表于 2026-8-17 14:13 | 显示全部楼层
楼主拍个名算了
回复

使用道具 举报

     
发表于 2026-8-18 10:24 来自手机 | 显示全部楼层
不写名字,怕被告么

—— 来自 鹅球 v4.0-alpha
回复

使用道具 举报

     
发表于 2026-8-18 13:43 | 显示全部楼层
没有名字,甚至没有直接暗示,经验总结疑似也是AI给出的,确实毫无意义
回复

使用道具 举报

     
发表于 2026-8-18 13:47 | 显示全部楼层
选45分钟的视频做为输入,你这评测还有眼看……?
回复

使用道具 举报

     
发表于 2026-8-18 14:01 | 显示全部楼层
含人量有多少

论坛助手,iPhone
回复

使用道具 举报

     
发表于 2026-8-18 14:02 | 显示全部楼层
1.33 这不一眼v4flash嘛
回复

使用道具 举报

     
发表于 2026-8-18 14:27 来自手机 | 显示全部楼层
谜语人+ai总结
回复

使用道具 举报

     
发表于 2026-8-18 20:20 | 显示全部楼层
这码打了跟没打不是一样,不就是ds和kimi吗

论坛助手,iPhone
回复

使用道具 举报

     
发表于 2026-8-18 21:14 来自手机 | 显示全部楼层
都放截图了为什么还当谜语人
回复

使用道具 举报

     
发表于 2026-8-18 23:42 | 显示全部楼层
一看就知道,最后两个便宜的那个是deepseek v4 flash,贵的那个是kimi k3kimi的api不开会员确实不是人用,烧钱太快了
回复

使用道具 举报

     
 楼主| 发表于 2026-8-19 00:06 | 显示全部楼层
各位好,论坛里发的内容含人量很高的。
确实怕被告。
只是一次经验分享,不涉及模型推荐。
但有些模型确实太贵了。办公上用不起。
回复

使用道具 举报

     
 楼主| 发表于 2026-8-19 01:35 | 显示全部楼层
鸳鸳相抱 发表于 2026-8-18 13:47
选45分钟的视频做为输入,你这评测还有眼看……?

第二轮里,3个模型用工具完成下载了字幕、视频、音频,对文案、剪辑、色调、人物出境(up主形象)都做了评价,确实是看了。另4个复用了3个模型的下载成果,但看没看,无法判断;4个其中1-2个连观后感都复用了,应该是没看。
回复

使用道具 举报

     
 楼主| 发表于 2026-8-19 01:38 | 显示全部楼层
rayaxu 发表于 2026-8-17 14:13
楼主拍个名算了

排名的话,对某1-2个才发布表现不稳定的模型不太公平,也不是这次帖子的重点。
这个帖子主要是对模型诚信、资源调度、人机对话的一个探讨。希望抛砖引玉,因为论坛里IT同业较多,但办公经营向的大家讨论还是太少。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|上海互联网违法和不良信息举报中心|网上有害信息举报专区|962110 反电信诈骗|举报电话 021-62035905|Stage1st ( 沪ICP备13020230号-1|沪公网安备 31010702007642号 )

GMT+8, 2026-8-29 13:15 , Processed in 0.093299 second(s), 7 queries , Gzip On, Redis On.

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表