圣者
精华
|
战斗力 鹅
|
回帖 0
注册时间 2012-2-27
|
发表于 2026-9-3 08:05
来自手机
|
显示全部楼层
本帖最后由 大暴死 于 2026-9-3 08:22 编辑
ISTA的IQ3-S模型昨天我也跑了zx-bench,综合分78.33,通过率83%
不过我没配置AI Judge模型所以生成不了AI报告,大佬AI Judge用的哪个,我应该也就deepseek V4f能用
生成的json丢给gemini 3.7flash,让他进行综合评判。最后总结给的评价确实挺高的:
综合评定与工程结论综合评级:A+(工业级工程可用基准)技术定性:在不借助 AI Judge 人工干预、纯靠自动化测试与代码规则提取(code_repair@3.2.0)的严苛条件下,能够在 195 道覆盖 8 门编程语言的综合题库中拿下 78.33 分、82% 通过率,这一成绩在目前 30B 级别的 3-bit 量化模型中处于顶尖水平; 特别是在并发控制、内存屏障、现代 C++ 移动语义与智能指针治理方面,该模型展现出了远超常规小模型的系统级架构理解力; 此测试进一步证实:ISTA-DASLab 的 GSQ-RCO 量化配方不仅在推理和博弈论上有惊人表现,其底层的 AST 代码结构表达与编译期类型约束理解,确实完全守住了 Q5~Q6 级别的实战精度。将其作为本地长期驻留的“研发主力大脑”是完全合格且令人放心的。
—— 来自 Xiaomi 25019PNF3C, Android 16, 鹅球 v3.5.99 |
|