完整测评报告视频:

一、推理&编程能力测评报告

Q1|强约束指令遵循句子生成测试 —— 9/10

任务:输出10个以汉字数字结尾的句子,且按照顺序一到十,语句要通顺有意义,且倒数第二个字不能重复且不能是”第”,”是”,”为”

实测结果:从1到10结尾通顺,无明显问题。
在这里插入图片描述

Q2|24点问题 —— 10/10

任务:请用 3、4、9、10 这四个数字,每个数字只能且必须使用一次。你可以使用任何初等数学运算符(包括乘方/根号),拼出 24 点。

实测结果:答案正确,10+9+3+√4=24
在这里插入图片描述

Q3|密码锁推理题 —— 10/10

任务:五位数密码锁推理:78635 含 3 个正确数字且位置全错;16384、56483 各 1 个数字位置正确、1 个数字位置错误;92741 有 2 个数字位置正确、1 个数字位置错误;67153 有 2 个数字位置正确、2 个数字位置错误,据此推理密码。

实测结果:答案正确,密码:12753,推理过程无误。
在这里插入图片描述

Q4|浏览器内操作系统(AISniper OS)—— 6/10

任务:参考macOS,制作浏览器操作系统桌面UI,包含状态栏弹窗、时钟、底部快捷栏、主题切换,内置可交互3D太空射击游戏。

存在问题:

  • 弹窗内容超出右边界
  • 终端输入框在右侧,缺少输入位置标识
  • 飞机子弹从机身腹部发射,而非机头前方

多处UI细节bug,扣分较多。
在这里插入图片描述

Q5|3D 赛车游戏 —— 8/10

任务:Three.js赛博朋克无限赛道游戏,摄像机跟随赛道平滑晃动、汽车避障物理反馈、实时计分板。

优点:UI观感不错,整体功能完整度高。
不足:碰撞障碍物一次直接结束游戏,缺少血量机制,对比其他模型容错偏低。
在这里插入图片描述

Q6|Trello 看板 —— 7/10

任务:原生单文件实现拖拽看板,卡片跨列拖动、列表换位、拖拽平滑让位动画、边缘自动滚动、卡片弹窗与子任务标签编辑。

优点:绝大多数拖拽、增删改功能正常。
不足:弹窗内两个功能按钮文字未居中靠左,属于细节UI瑕疵。
在这里插入图片描述

推理编程测评总结
推理能力稳定在线,数学类题目(24点、密码锁)全部拿满分数;编程生成项目可以跑通,但UI小问题偏多。
浏览器OS弹窗超界、终端输入位置不对;赛车UI不错但撞车一次就挂设计不合理;Trello按钮文字未居中。
综合表现不及 Qwen 3.8 Max Preview(54分),但整体仍然属于可用水平。

二、多模态能力测评报告

背景:125B参数规模可以拿到这样的表现实属难能可贵,下面使用另一套祖传测试用例测试图片、视频理解能力。

Q1|电影剧照识别(老无所依)

任务:上传《老无所依》截屏,识别影片名称,开启推理+联网搜索

实测结果:模型将《老无所依》列入候选,但判定概率较低;最终识别错误,判定为《星际穿越》。
在这里插入图片描述

Q2|经典画面二次识别(老无所依)

任务:上传《老无所依》经典镜头,识别影片名称

实测结果:成功识别出影片为《老无所依》,回答正确。
在这里插入图片描述

Q3|空间方位判断

任务:判断图片当中电话亭是否在黄色车辆的右边

实测结果:模型正确判断电话亭在黄色车辆的右边,方位识别无误。
在这里插入图片描述

Q4|细微图形差异查找

任务:找出一组形状当中角度倾斜不一样的图形,肉眼分辨难度较高

实测结果:精准定位第一行第四列菱形,识别出图形倾斜,答案正确。
在这里插入图片描述

Q5|物种计数区分(鸳鸯+野鸭)

任务:统计图片内雄性鸳鸯、雌性鸳鸯数量,最左侧个体为野鸭,不计入雌鸳鸯

实测结果:雄性鸳鸯数量识别正确;雌性统计出错,误将野鸭计入,得出雌鸳鸯5只的结论。
在这里插入图片描述

Q6|视频时序理解(行车片段)

任务:上传清晰度一般的行车视频,识别车辆开始并线、右转的时间节点

  • 模型回答:5‑6秒开始并线,13‑14秒开始右转
  • 真实时间:5‑6秒并线正确;右转实际8‑9秒启动,模型时间偏差较大
    在这里插入图片描述

多模态测评总结
综合整套多模态测试下来,千问3.8‑Flash整体表现不错。以它这个参数体量,能达到当前识图水准已经算得上可用;短板集中在复杂计数区分、长视频时间轴识别,视频时序判断误差较为明显。

对于Qwen 3.8‑Flash这套实测结果,你有什么看法?欢迎评论区讨论。

Logo

openEuler 是由开放原子开源基金会孵化的全场景开源操作系统项目,面向数字基础设施四大核心场景(服务器、云计算、边缘计算、嵌入式),全面支持 ARM、x86、RISC-V、loongArch、PowerPC、SW-64 等多样性计算架构

更多推荐