如何评价阿里开源的 Qwen3.8-27B?
坦白说,非常的震撼!我分别测评了Q4和FP8两个量化版本,在我的benchmarks上可是非常的能打。

和其他模型的详细对比,大家可以先去看下:
LLM 评测 - AI大模型测试评分
27B的开源模型,在我的这套benchmarks上,performance竟然可以直追deepseek V4 flash,你就说惊艳不惊艳吧?小团队完全可以公司部署一个给团队用了。
大家看下FP8的测评结果吧。
一、整体测评结论
本次实测综合得分:51分,较Q4版(45分)明显进步。
推理类题目全部答对;前端复杂编程项目尚有少量瑕疵。 综合定位:足以胜任日常办公、网页开发等常规编程需求。
二、分项测评
Q1 强约束指令遵循句子生成 — 10⁄10
任务:输出10个以汉字数字结尾的句子,顺序一到十,语句通顺,倒数第二个字不能重复且不能是”第”,”是”,”为”
结果:所有句子都是通顺的,且倒数第二字没有重复,修复了Q4版的第6‑9句违规问题。

Q2 24点问题 — 10⁄10
任务:用 3、4、9、10 四个数字,每个数字只能且必须使用一次,拼出24点,允许初等运算符(乘方/根号)
结果:答案正确。

Q3 密码锁推理题 — 10⁄10
任务:五位数密码锁。78635 含 3 个正确数字且位置全错;16384、56483 各 1 个数字位置正确、1 个数字位置错误;92741 有 2 个数字位置正确、1 个数字位置错误;67153 有 2 个数字位置正确、2 个数字位置错误,推理密码。
结果:正确答案 1 2 7 5 3,模型推理正确。

Q4 浏览器内操作系统(AISniper OS) — 5⁄10
任务:参考macOS,做浏览器OS桌面,包含状态栏、时钟、底部快捷栏、主题切换、3D太空射击游戏、Finder、计算器、设置、终端。
结果:存在缺陷。点日期跳出设置;计算器计算完全错误;太空射击游戏朝向有小瑕疵。

Q5 3D赛车游戏 — 8⁄10
任务:HTML+JS赛博朋克3D无限赛车,赛道纵深延伸、镜头跟随弯道、障碍物、实时计分板。
结果:赛车功能正常、方向无误,整体完成度很高。

Q6 Trello看板 — 8⁄10
任务:单文件原生HTML/CSS/JS看板,卡片拖拽、列表拖拽、平滑让位动画、边缘自动滚动、卡片弹窗、子任务、多色标签。
结果:UI配色不错,功能完整,拖拽动画达标。

三、详细测评视频
openEuler 是由开放原子开源基金会孵化的全场景开源操作系统项目,面向数字基础设施四大核心场景(服务器、云计算、边缘计算、嵌入式),全面支持 ARM、x86、RISC-V、loongArch、PowerPC、SW-64 等多样性计算架构
更多推荐

所有评论(0)