OpenAI在复杂场景多要素平衡上比Qwen更靠谱

用最简单的prompt测试了一下图片生成效果:"中国唐代的士兵拿着兵器站在城门口盘查过往行人"。结果挺有意思的。 OpenAI的表现最好,who、where、what三个要素都覆盖到了。士兵的服饰、兵器、城门口的场景,还有盘查路人的动作,都还原得比较到位。从画质来讲,真实感也更胜一筹。 Qwen的两个模型明显过分强调了who,也就是士兵本身,对于盘查路人这个动作覆盖不明显。画面里士兵很突出,但路人的存在感很弱,整体叙事感差了一些。 这个测试虽然简单,但能看出不同模型在理解复杂场景时的差异。OpenAI在多要素平衡上确实做得更好,Qwen可能更擅长突出主体,但在场景叙事上还有提升空间。 对于需要生成包含多个角色和复杂场景的图片来说,OpenAI目前还是更靠谱的选择。不过Qwen在某些特定场景下也有自己的优势,比如主体突出、细节丰富。
17 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单