当前位置:首页 > 焦点 > 手绘图直接变海报,国产开源多模态模型把图片玩“活”了|草图_网易订阅 正文

手绘图直接变海报,国产开源多模态模型把图片玩“活”了|草图_网易订阅

来源:知来藏往网   作者:探索   时间:2026-08-09 01:24:46
手绘图直接变海报,国产开源多模态模型把图片玩“活”了|草图_网易订阅
智东西作者 杨京丽编辑 李水青一张只有便捷线条、活栏目框架和步骤箭头的手绘手绘草图,交给AI后,图直态模图片图网能否直接变成一张顺应商业出版原则的接变“深海潜水装备步骤”高精海报?下面这个案例中,模型不仅识别出了草图中的海报氧气瓶、面镜、国产潜水电脑表等装备,开源还保留了“装备总览、多模功能详解、型把下潜前检查、玩草安全下潜步骤、易订阅下潜后检查”五部分结构,活并为不一样栏目补充图片、手绘图标和验明正身文字,图直态模图片图网将原本粗略的接变构想变成了一张深蓝科技风的完善设方式图。▲模型根据草图生成彩绘海报从草图到彩绘海报,AI需读懂材料和结构,按需补全细节、统一风格,还关键保留不能改动的部分。实现这项任务的,是商汤最新开源的轻量级原生统一多模态模型SenseNova U1.5-Lite-Preview。一、8B轻量化体量,跑出硬核生成与编辑性能作为SenseNova U1开源模型的升级版,U1.5-Lite-Preview最大的亮点在于:以仅8B-MoT的轻量化规模,集成了看图、视觉推理、4K极清生成与高精度编辑的全套能力。它延续了商汤自研的NEO-Unify原生统一多模态架构,摒弃了传统方式划中模型拼接的低效模式,在单一网络内部实现了多模态材料的统一表征与交互。从评测成绩来看,U1.5-Lite-Preview的Qwen-Image-Bench成绩由U1的47.14分大幅跃升至55.20分,在研究图像编辑能力的GEdit-Bench测试中,英文项(8.17分)与中文项(8.05分)均超过了一众大参数级别的开源及闭源模型。▲SenseNova U1.5-Lite-Preview评测成绩同时,SenseNova U1.5-Lite-Preview最直观的变化,体目前4K画质、复杂提示词实施、参考图创作和图像编辑等能力中。目前,该模型已在全球开源,开发者可通过Hugging Face、GitHub及魔搭社区免费获取与部署。开源地址:GitHub:https://github.com/OpenSenseNova/SenseNova-U1/blob/main/docs/u1.5_preview.mdHugging Face:https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT-Preview魔搭社区:https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT-Preview二、复杂提示词也能“看懂”,4K画质同步升级用户如果只想生成主体清楚、构图便捷的画面,常见用几句自然语言描述即可。但制作材料图、商业海报和品牌视觉材料时,用户频仍需同时验明正身主体、布局、文字、风格以及需保留或避免的材料,相当于向模型提交一份完善的创作方式划。SenseNova U1.5-Lite-Preview在U1的基础上,提高了提示词比如能力和首先上下文视觉控制能力。面对首先篇、多约束的提示词,模型可以将详详见细的需落实到同一张画面中。U1.5-Lite-Preview的强提示词比如能力并不是靠记住某种固定模板。即使没有高度依赖专业的Prompt Enhance格式化数据训练,模型也能较为稳固地实施首先篇、多约束和层次化的视觉指令,这也是原生统一多模态架构带来的好处之一。这一案例需模型以横向首先卷呈现二十四节气,并按照时间顺序分类成多个竖向栏目。每个栏目都关键涵盖节气名称、日期和对应的自然景观,同时保持中式绘画风格,并通过植物、天气和色彩变化展现四季流转。▲模型生成的二十四节气全景图从成效来看,画面从春季的柳树、花田逐渐过渡到夏日荷花与向日葵,再转入秋日麦田、红叶和冬季雪山。二十四个栏目材料密集,但节气名称、画面和文字材料保持了较清楚的层级,四季之间的色彩变化也自然连贯。当然,复杂创作并不意味着用户必须自己手写数千字提示词。商汤还设方式了实验性的Prompt Enhance Skill,它可以把相对那么点儿的想法补充成涵盖主体、布局、风格、文字和限制需的结构化创作方式划。便捷任务可以直接描述,复杂任务则可以借助这项工具把需说得更完善。听懂复杂需之后,画面还关键经得起放大。SenseNova U1.5-Lite-Preview原生协助4K图像生成,这对人物皮肤、产品材质、建筑纹理和环境光影等细节和整幅画面的相同性提出了更高需。在这张渔民整理渔网的4K图片中,渔网交错的线结、船身斑驳的油漆、机械设备上的锈迹均清楚可见,远处的水面倒影、岸边房屋和电塔也保留了空间层次。画面容纳了大量细碎物体,人物、渔网和船舱设备之间仍保持较清楚的边界,整体光影与色彩也较为统一。▲模型生成渔民整理渔网4K图从复杂提示词到4K细节,SenseNova U1.5-Lite-Preview既能把需画出来,也能让生成结荚经得起放大。三、看懂参考图再创作:既能借鉴风格,也能组合素材除了文生图,SenseNova U1.5-Lite-Preview还可以根据参考图后续创作。用户有时希望借鉴一张图片的配色、构图和设方式语言,再将主题替换成自己的材料;有时则需分别采取多张图片中的人物、产品、场景或其他元素,把原本互不相关的素材组合成一张新图。这类任务需模型能看懂图片,还关键判断应该从每张图中取出什么,以及怎样按照新需重新组织。依托原生统一多模态架构,SenseNova U1.5-Lite-Preview可以识别并理解图片,根据用户需,开展创作。在下面这个案例中,模型以可再生能源主题海报为参考,沿用其棕褐色复古质感、红白大字排版和剪影式构图,重新生成了一张“古代香料贸易”主题海报。▲模型根据单一参考图风格创作从成效来看,模型将原图中的风机和太明确能板替换成帆船、骆驼、陶罐和香料,并在地球上加入跨区域贸易路线。新海报的主题和材料已经完全变化,但画面构图、色彩、文字层级和复古颗粒质感都与参考图保持呼应。如果创作需多张素材,模型还可以分别提取不一样图片中的材料。再看这组多参考图创作,三张人物参考图分别呈现金发黄衣少女、黑发狐耳红衣少女和蓝衣少女。模型需提取她们的外貌、服饰和配饰特点,再将三个人物放入同一场景中。▲模型根据多参考图创作从成效来看,三个人物的发色、服装配色和标志性装饰都得到较好保留,画面还以金色火光、红色花瓣和蓝色能量分别呼应不一样人物。人物站位、光影和前后层次被重新组织,统一构图。四、改文字、换元素,AI最初接手精细改图参考图创作关注的是“从输入图片中取出什么,再怎样重新组合”,但很多时候,用户已经有一张不错的图片了,只想修改其中的一处材料。例如,设方式把产品海报做好了,但上线日期却临时发生调整。用户只想替换一个日期,结荚AI把整张海报重新生成了一遍,原本满意的构图、文字排版和画面风格也跟着变了。这正是SenseNova U1.5-Lite-Preview此次提高的题,它能够精准判断“哪里需改,哪里不能动”。依托统一架构,它可以在同一个模型中实现看图、定位和图像编辑的全步骤。如果想调整画面元素的排版、把英文海报改成中文,或者替换图片中的某个产品、某段文字,模型可以根据需实现修改,不意义其他材料。在桥梁加固海报的排版调整中,模型将“改造前后”的比较图放大并移至画面中央,把主标题和四项好处调整到下方,同时保留背景中的铁路桥、原有文字材料以及做旧的工业风格。修改后的材料题更加突出,画面层级也更清楚,其他不需调整的部分则基础保持不变。▲模型根据提示修改海报排版除了调整整张海报的排版,模型还可以单独修改图片中的文字。此时模型把材料替换正确的同时,还关键保留原有字体、材质、光照和透视关系,让新文字看起来仍是画面的一部分,同时其他部分不可以改动。提示词:请将门上方由灯泡组成的招牌里目前显示的“VACKER”替换为“MARKET”。▲模型根据提示词修改海报文字从结荚来看,模型准确修改了文字,同时保留了招牌原有的立体字造型、灯泡排列、金属质感和光照成效,门窗、墙面等其他区域也没有发生变化。如果单靠文字不那么点儿说清修改位置,用户还可以直接在图片中圈出目的区域,再通过提示词验明正身需替换、提高或删除什么。▲模型根据圈画标记修改图片这一案例通过彩色标记指定了三个编辑区域,并分别写明“添加黏土狮子”“添加黄色黏土人偶”和“添加黏土首先颈鹿”。模型按照标记位置补充了对应角色,并让新增元素的黏土质感、光影和景深与原图保持相同。前景中的兔子、花朵和蓝色水壶则基础没有变化,实现了对多个指定区域的同时编辑。从局部元素、画面文字到指定区域,SenseNova U1.5-Lite-Preview带来了多种不一样粒度的编辑方式。图片生成后不再只是一次性的输出结荚,而可以成为下一次修改的基础。用户可以后续调整文案、版式和画面元素,逐步把结荚改到更接近预期。对于不少日常的海报调整和照片二次创作来说,PS或许还不能真的卸载,但肯定可以少打开几次了。结语:小规格模型后续向生成、编辑闭环迈进从SenseNova U1到SenseNova U1.5-Lite-Preview,商汤此次在轻量级的规格下,大幅提高了模型的4K图像生成、复杂提示词比如、参考图创作和图像编辑能力。从“能画图”到“改好图”,也体现了国产开源多模态模型在商业化落地与可控生成领域的又一个突破。智东西获悉,SenseNova U1.5-Lite正式版也将在近期推出并开源,届时还将在图像生成和编辑等部分进一步改进。对于一款轻量级统一多模态模型来说,如何在有限的模型规模内后续提高生成质量、编辑稳固性和视觉控制能力,将是正式版更值得关注的部分。

标签:

责任编辑:休闲

全网热点