8月13日夜,贤者时间,无聊。
我选了一段 45 分钟、含一手信源、无字幕的专业财经长视频作为统一考题(视频内容本身不重要,以下全部隐去)。实验分四步:
第一个步骤是设立了一个初始评测对象——一个B站的视频,要求6个被评测知名国产大模型(主要来基于鹅厂wb界面,wb内置大模型有3个、外部api接入3个),对视频内容的真实性、up论据、up论点进行汇总、验证和评价(在第一个问题我就明确告知这是个测试),并追问了2个问题。各大模型在此阶段已经有明显的表现区别,主要还是在工具资源调动的积极性、推理能力上。
第二个步骤是在第一步的基础上,要求7个大模型(wb内置大模型有4个、外部api接入3个,增加了一个内置)对第一轮6位选手的表现,进行深度评价。这个时候就发现各大模型在理解意图的能力、执行意图的忠诚度、执行意图的决断力/资源调度能力上居然有了不同。一些大模型与我发生了多次对话,走捷径、借鉴/作弊的行为已经在部分大模型身上发生。
第三个步骤是我对第二个步骤中的可疑大模型进行了再次追问,这个阶段被追问的大模型似乎都做了合理解释。摆烂的继续摆烂。有1大模型(api接入,充了值的)在此处发癫、语无伦次、前后矛盾。
前三轮途径如下:

第四个步骤是最后用4个表现较好的大模型,对前三步中,各大模型的表现进行审计和评价。结论趋同。摆烂的、作弊的基本都被揪了出来。
结论:
1、大模型能力确实天差地别。
有个免费大模型多次理解意图出错、“误用”别家结论/产物;考虑其为免费且在wb的地位特殊,归为不可用。
有个wb内置大模型直接摆烂,直接“复用”“抄袭”不做申明。归为不可用。
有个才发布的知名大模型(api版)任务多次中断、理解出错。结合内置版让我非常满意的长期表现,我感觉是匆忙发布期间的技术问题,不涉及品格。会继续留用。
有个多模态知名大模型(api版)推理任务理解能力偏下,第二轮后就不再参与测试。考虑生图、生视频的小需求,会继续留用。
一半大模型在第二轮测试开始没有意识到工具调动的重要性,被提醒了才下载/复用其他大模型已经下载的产物。
2、大模型在现阶段执行长上下文任务依然存在缺陷
第一轮测试的是重要任务的推理能力和资源调度的积极性、第二轮测试主要是理解复杂意图的能力、第三轮测试主要是人机对话可信任度、第四轮是超级任务的推理能力。
综合四轮下来,多多少少都出了一些问题。
表现最好的大模型(api版),在第四轮中也为了赶时间/节约资源出现理解上的小偏差(前三轮表现可堪称完美),但作为flash版,也算我最满意的。4轮任务花费1.33。满意。
表现次好的大模型(api版),在第四轮中也出了理解和调研上的瑕疵和问题且没有自查到(而且我用内置的同版本做了复核),考虑其超高的成本(4轮任务47块含赠送,卧槽),让我不得不将其归为慎用一栏。


经验:
评测要内置"探针":高精确提示词、清晰直接的要求、在能力边界上的直接追问,很重要。绝大多数大模型调取资源能力应该大同小异,但理解力、决策力、执行力有差别,造成诚信度、结果复用上有差别。
独立任务需要"隔离":大模型一旦读过他人结论,独立性即被污染,"假装没读过"不可能——重开会话是唯一解法。尤其是对经营者结构化思考、风险评估等领域,需要诸多大模型、多对话窗口并行的,一定要注意物理隔离。 警惕"冒名":确认调用的模型身份与宣称一致——API 直调与平台内置,质量可能天差地别。wb这点还做得不错。
|