觅漫 AI 漫剧平台 · 创作者教程 用 AI 觅见心动,让故事漫生成剧轻量高效漫剧创作平台,人人皆可做漫剧

基础教程:10 分钟完成一条视频

跟着真实界面操作。每一步只保留动作和结果,先做出来,再优化。

1

登录觅漫账号

打开 imiman.cn/login,用手机号验证码登录或注册。登录完成后进入创意坊,再开始生成任务。

  • 输入手机号,点击发送验证码。
  • 填写验证码后点击登录 / 注册。
  • 如果已经登录,页面会自动跳转到创意坊。
觅漫登录页截图
2

进入创意坊,先找创作入口

登录后默认进入创意坊。左侧是固定工作导航,中间是漫剧入口、快捷生成输入框和平台案例。

  • 确认左侧有创意坊、生成、项目、资产。
  • 先不要进入复杂项目,直接用中间的生成输入框开始。
  • 如果要找灵感,看下方图片和视频案例瀑布流。
觅漫创意坊首页截图
3

用基础提示词描述画面

第一次不要追求复杂。把场景、主体、动作、风格写清楚,再加上不要字幕和不要 logo。

一部温暖高级的城市文旅宣传短片。岭南老街在清晨阳光中苏醒,骑楼建筑、青石街巷、茶楼蒸汽、街边小店和行人自然交织。镜头从街巷低角度缓慢前行,经过一盏老式灯笼、一壶热茶、一位老人微笑看向街道,随后切换到城市天际线与珠江水面倒影。整体画面有生活气息、文化底蕴和温暖人情味,电影级纪录片质感,光影柔和,真实自然,不要字幕,不要 logo。
觅漫生成输入框与参数区截图
4

选择生成类型、模型和参数

基础任务建议先用文生视频。参数保持默认即可,减少变量,先拿到第一版。

  • 类型:文生视频。
  • 模型:HappyHorse 1.0 T2V。
  • 分辨率:720P。比例:16:9。时长:3s 或 5s。
  • 积分足够后点击右下角渐变生成按钮。
觅漫参数选择区截图
5

到生成页检查结果

生成记录页会保留生成方式、模型、分辨率、比例、时长、时间和完整提示词。这里是复盘提示词最重要的地方。

  • 结果满意:下载或进入资产复用。
  • 方向正确但不够好:点再次生成。
  • 想微调内容:点重新编辑,保留原提示词继续改。
觅漫生成记录页截图
6

进入项目,把素材变成漫剧流程

项目页适合长内容。小说生成漫剧用于单集或多集剧本,无限画布用于自由创作。

  • 短视频素材先在生成页打磨。
  • 成片项目再进入项目页管理剧本和分镜。
  • 同一个项目的角色、场景、视频素材保持在一个空间内。
觅漫项目页截图
7

在资产页复用角色、场景和成片

生成结果会沉淀到资产。真正的提效来自复用:角色图、场景图、参考视频和成片都应该按项目管理。

  • 用筛选器区分图片、视频和数据来源。
  • 上传常用角色、场景、产品图,后续用作参考素材。
  • 把高质量结果收藏,后续做续写、编辑和多图参考。
觅漫资产页截图

进阶教程:如何成为一个导演

进阶创作不靠堆形容词。先锁定主体和动作,再交代场景、光影、镜头、风格与约束。

场景时间、地点、前景、背景、光线和环境氛围。
主体谁出现,来自哪张图,外观如何保持一致。
运动主体动作、非主体运动、动作幅度、速度和承接。
音频台词、旁白、语气、音效和环境声,按可朗读文本写。
镜头景别、视角、推拉摇移、切镜和分镜顺序。
约束无字幕、无 logo、脸部稳定、动作自然、无闪烁。
图生视频情绪表演

短剧情绪对手戏

适合角色关系、对白和近景表演。重点写清楚动作承接、表情变化和镜头拉近。

参考图片中的男孩与机器人,夜晚月光下,两人轻轻牵手站在空地上。镜头先给男孩真诚的近景,他轻声说:“我们是朋友。”机器人眼部灯光轻微闪烁,停顿后用机械音回应:“我们……是朋友。”男孩露出开心笑容,缓慢抬手轻拍机器人的头。镜头从近景缓慢拉到中景,画面温暖、电影感、表情自然,角色外观稳定,不要字幕,不要 logo。
分镜紧张氛围

西部片对峙

动作不需要大,手指、眼神、呼吸和镜头切换能制造更稳定的张力。

荒漠小镇正午,两名牛仔在木质街道中央对峙。镜头 1:远景展示空旷街道和被风吹起的尘土。镜头 2:切到年长牛仔的手指,手指在枪套旁轻微颤动。镜头 3:切到年轻牛仔的眼神特写,他呼吸放慢,目光坚定。镜头 4:两人同时停住,镜头缓慢推近到两人之间。整体为复古胶片质感,高对比光影,紧张沉默,不要字幕,不要 logo。
主体定义参考素材

用素材锁定人物

同一人物跨镜头出现时,先定义主体,再持续使用同一个名称,避免指代漂移。

将图片 1 中穿浅色外套、短发、面部轮廓清晰的女孩定义为女主。镜头 1:女主站在傍晚的教学楼走廊,双手握着书本,轻轻低头,表情有些紧张。镜头 2:女主抬头看向镜头,嘴角缓慢上扬,眼神变得坚定。镜头 3:镜头从中景缓慢拉远,走廊灯光逐渐亮起。女主外观保持一致,动作自然连贯,画面清新电影感,不要字幕,不要 logo。
商品展示图生视频

产品细节展示

电商视频重点是“拿起、旋转、靠近镜头”,让模型知道怎么展示卖点。

背景为暖调居家桌面,中景呈现参考图中的保温杯。镜头平稳推近到保温杯近景,画面外一只手自然入镜,轻握杯身拿起保温杯,顺势缓慢旋转,展示杯身材质、杯盖结构和正面标识。光线柔和干净,商品边缘清晰,画面高级真实,不要字幕,不要 logo。
视频编辑前后对比

只改指定元素

编辑任务要写“严格编辑视频 1”,没有提到的主体、动作和镜头默认保持。

严格编辑视频 1,将画面背景替换为高端时尚 T 台现场。背景为模糊观众席、闪烁聚光灯和反光黑色 T 台地板。人物原有姿势、服装、步态和镜头运动保持不变。整体光照改为专业秀场灯光,在人物头发和肩膀边缘增加精致轮廓光,画面高级、干净、浅景深,不要字幕,不要 logo。
视频延长对白续写

延续原片叙事

延长任务不要写“参考视频 1”,直接写向前或向后延长视频 1,保持风格和角色。

向后延长视频 1,保持原视频的人物外观、空间关系、光影色调和镜头语言。镜头切到白衣男子的过肩近景,他语气平稳地说:“It’s not that bad. You're just stressed. Everyone goes through this, you just need to keep going.” 对话节奏自然,人物口型与声音匹配,表情稳定,不要字幕,不要 logo。
风格转化图生视频

从卡通到现实

风格变化要写清楚转变发生在哪个动作之后,避免整段混成一种风格。

参考图片中的卡通角色。角色先在画面中央轻快跳舞,身体小幅摆动,转身一圈后,画面从卡通质感自然过渡为真实场景。角色动作保持连贯,转场顺滑,光影从插画柔光变为真实电影光线。镜头中景固定,最后给角色真实质感近景,画面稳定,不要字幕,不要 logo。
电商直播数字人

电商直播

覆盖产品广告、商品展示、口播带货等核心链路。模型生成的视频画面质感高、产品还原度好,数字人口播自然流畅,能够有效支撑商家从素材制作到投放的规模化内容生产需求。

一个年轻的漂亮女企业家优雅的坐在椅子上接受采访。采访场景辅助背景,虚化的办公环境/书架/绿植,轻微景深变化营造空间感,光线柔和均匀不抢主体,镜头几乎静止仅有微呼吸感,专业访谈节目质感,生成口播视频,主播说:其实我们从一开始就很明确,核心目标是解决用户真正在意的问题,而不是单纯追求技术上的突破。
案例视频首帧
社媒创意拟人化短视频

拟人化社媒创意

社媒传播型创意。重点是让角色造型、可爱动作、方言台词和短视频节奏形成记忆点。

参考图片中的菠萝,将菠萝拟人化处理。菠萝站在明亮厨房台面上,先左右摆出几个可爱的 pose,然后面向镜头,用河南话自然地说:“老乡,你吃饭了没,要不要吃美味的大菠萝。” 说话时身体轻微摇晃,表情可爱,动作和台词同步,画面真实有趣,适合短视频传播,不要字幕,不要 logo。
文字生成对白气泡

可控文字效果

需要生成文字时,只用常用字,写清出现位置、颜色、时机和对应角色。

参考图片 1 的人物和构图。女孩看向男孩,自信地笑着说:“We can definitely do it!” 镜头切到男孩近景,他犹豫地回答:“Are you sure?” 镜头切回女孩中近景,她语气轻快地说:“Yes!” 说话角色旁边出现白色圆角气泡,气泡中显示对应英文台词。气泡位置跟随角色,不遮挡面部,画面明亮清爽。

高频模板

把模板复制到觅漫生成框,替换主体、场景、动作和风格即可。

提示词书写规范 场景 + 主体 + 运动 + 音频,再补镜头、风格和约束。
先写可见信息主体、动作、场景、镜头、风格按顺序组织,少用“高级”“好看”这类空词。
首帧只写变化图片已有的静态内容不用重复,重点写动起来之后发生什么。
多图明确用途按上传顺序引用图片 1、图片 2,说明哪张管角色、场景、风格或分镜。
编辑写保留项写清“改什么”和“保留什么”,避免人物、动作、构图被误改。
台词匹配时长口播、对白按正常语速能说完来写;5 秒视频不要塞 10 秒台词。
数字单位写全涉及口播时少写缩写和歧义数字,用自然朗读方式写金额、时间和单位。

数字与单位:写成“希望被念出来”的样子

只要提示词里包含口播、对白、旁白或语音,就不要直接丢缩写、日期格式和长数字。模型会把它当作朗读文本处理,写法越接近真人朗读,发音和节奏越稳定。

日期不要写:2026/03/15推荐写:二零二六年三月十五日
时间不要写:下午3:45推荐写:下午三点四十五分
金额不要写:¥1,299.00推荐写:一千二百九十九元整
速度 / 重量不要写:120km/h、5kg推荐写:每小时一百二十千米、五千克
电话号码不要写:13812345678推荐写:幺三八一二三四五六七八
英文数字不要写:$3.50、3:45 PM推荐写:three dollars and fifty cents、three forty-five PM

台词长度:按视频时长控制字数

台词过长时,模型会被迫加速、吞字或截断,口型也更容易不同步。写完后用正常语速读一遍,读不完就删减。

视频时长中文台词参考上限英文台词参考上限
5 秒约 15-40 字约 10-15 词
10 秒约 30-80 字约 20-30 词
15 秒约 45-120 字约 30-45 词

不同素材模式的写法

文生视频:按“主体 → 动作 → 场景/背景 → 镜头运动 → 风格/氛围”组织,避免互相冲突的动作。

首帧图生:图片已经决定第一帧,不要重复描述静态画面;重点写后续动作、运动轨迹和镜头变化。

多图参考:按上传顺序写清图片 1、图片 2、图片 3 的用途,比如角色、场景、风格、分镜。

视频编辑:明确写“改什么”和“保留什么”;例如背景替换时要写人物动作、表情、镜头和构图保持不变。

提示词规范总模板

适合先搭骨架,再替换成具体内容。

【场景】(时间、地点、前景、背景、光线、环境氛围)。
【主体】(人物/动物/商品/物体),外观特征为(服装/材质/颜色/身份/状态)。
【运动】主体先(动作 1),随后(动作 2),最后(动作 3);非主体元素(风/水/烟雾/灯光)同步发生(运动)。
【镜头】(景别)开始,镜头(推近/拉远/环绕/跟拍/切换),在(关键时刻)切到(特写/中景/远景)。
【音频】(角色/旁白)用(语气/音色/语速)说:“(台词)”;环境中有(音效)。
【风格】(电影感/广告质感/短剧质感/写实/动画/胶片),光影为(柔和/高对比/逆光/霓虹)。
【约束】动作自然,主体稳定,口型同步,画面无闪烁,不要字幕,不要 logo。

文生视频基础模板

适合从零开始生成 3 到 8 秒短片。

【场景】(时间、地点、环境氛围)。
【主体】(人物/动物/商品/场景核心元素)。
【运动】(主体动作 + 镜头运动 + 动作承接)。
【音频】(台词/旁白/音效/环境声,可选)。
【风格】(电影感/纪录片/电商广告/赛博朋克/复古胶片)。
【约束】画面稳定,主体不变形,动作自然,无闪烁,不要字幕,不要 logo。

首帧图生视频模板

适合把单张分镜图、角色图、产品图动起来。

以图片 1 作为视频第一帧,保持图片 1 中的(主体/角色/产品)外观、构图和色彩。随后让(主体)开始(具体动作),镜头(轻微推近/缓慢环绕/固定机位微呼吸)。场景光影延续原图风格,动作自然连贯,主体不变形,画面稳定,不要字幕,不要 logo。

首尾帧视频模板

适合确定开场和落点,只生成中间过程。

以图片 1 作为首帧,图片 2 作为尾帧。中间过程为:(主体)从(首帧状态)自然过渡到(尾帧状态),期间发生(动作/表情/镜头运动)。人物外观、服装、发型和场景风格保持一致,动作衔接平滑,尾帧构图准确落到图片 2,不要字幕,不要 logo。

多图参考模板

适合角色、场景、道具分别来自不同素材。

将图片 1 中的(主体核心特征)定义为(角色名),图片 2 作为(场景/风格/道具)参考。镜头 1:(角色名)在(场景)中(动作),镜头(运镜)。镜头 2:(动作变化和情绪变化)。整体保持(角色名)外观一致,融合图片 2 的环境和风格,画面高清稳定,不要字幕,不要 logo。

角色一致性模板

适合同一角色跨镜头、跨场景出现。

将图片 1 中的(发型/服装/面部特征/体型)定义为(角色名)。镜头 1:(角色名)在(场景 A)中(动作和情绪)。镜头 2:(角色名)移动到(场景 B/新角度),继续(动作变化)。全程保持(角色名)的脸型、发型、服装、年龄感和气质一致,镜头切换自然,画面稳定,不要字幕,不要 logo。

多模态广告模板

适合图片、视频、音频共同驱动的广告片。

全程参考视频 1 的(第一视角构图/运镜节奏/动作方式),使用音频 1 作为(背景音乐/口播音色/节奏参考)。图片 1 作为开场画面,图片 2 作为产品落点。0-2 秒:(开场动作);2-4 秒:(制作/展示过程);4-6 秒:(产品特写和卖点);6-8 秒:(递到镜头前/品牌定格)。产品外观清晰,节奏与音频匹配,尾帧定格在图片 2,不要字幕,不要 logo。

视频参考运镜模板

适合复用参考视频的动作、机位和转场方式。

参考视频 1 的(运镜方式/动作节奏/转场结构),生成一个新的(场景/主题)视频。主体替换为(新主体),场景替换为(新场景),但保留视频 1 的镜头速度、运动轨迹、景别变化和关键转场。新画面风格为(风格),动作连贯,镜头稳定,不要字幕,不要 logo。

音频口播模板

适合数字人、产品讲解、品牌采访。

固定机位,近景镜头,(清新自然/专业访谈/电商直播)风格。图片 1 中的(人物/虚拟人)面向镜头,使用音频 1 的音色自然说:“(口播台词)”。人物居中,完整展示头部和上半身,始终对焦人脸,口型与台词同步,表情自然,背景为(办公室/居家/直播间),画面干净,不要字幕,不要 logo。

替换指定元素模板

适合替换背景、局部修改、增加元素。

严格编辑视频 1,将其中的(原元素/原背景/原属性)修改为(新元素/新背景/新属性)。视频中未提及的人物、动作、镜头运动、构图保持不变。新元素与原画面光影、透视、色调自然融合,画面稳定真实,不要字幕,不要 logo。

删除指定元素模板

适合去掉路人、杂物、文字、瑕疵。

严格编辑视频 1,删除画面中的(需要删除的元素),并用周围的(背景/地面/墙面/天空/桌面)自然补全。保留视频中未提及的人物、主体动作、镜头运动、光影、构图和色调不变。修复区域不要闪烁,不要出现残影,不要字幕,不要 logo。

增加指定元素模板

适合给原视频增加道具、特效、装饰物。

严格编辑视频 1,在(出现时机)于(画面位置)增加(元素名称)。该元素具有(材质/颜色/大小/动态),与原视频的透视、光影、景深和运动方向一致。原视频中的人物、主体动作、镜头运动和背景保持不变,新增元素不遮挡关键主体,画面稳定,不要字幕,不要 logo。

向后延长模板

适合把已有片段继续讲下去。

向后延长视频 1,保持原视频的人物外观、场景空间、光影色调、镜头语言和情绪节奏。延长内容为:(接下来发生的动作/对白/镜头变化)。动作从原视频结尾自然接上,角色状态稳定,口型与台词同步,画面无跳变,不要字幕,不要 logo。

向前延长模板

适合给原视频补一个自然开场。

向前延长视频 1,生成原视频开始前的(动作/铺垫/环境建立)。延长片段最后自然接回视频 1 的第一帧,人物外观、场景空间、光影色调和镜头运动保持一致。开场节奏为(缓慢/紧张/轻快),衔接处无明显跳变,不要字幕,不要 logo。

多视频串联模板

适合把 2 到 3 段素材接成完整叙事。

视频 1 中的(结尾动作/空间入口)触发转场,过渡到(过渡画面描述),接视频 2;随后通过(镜头推进/画面匹配/动作衔接)进入(下一段过渡),接视频 3。三段视频的色调、光影、景别和运动方向统一,转场自然,叙事连贯,不要字幕,不要 logo。

短剧对白模板

适合人物对手戏、关系反转、情绪爆点。

(场景),(时间和光线)。角色 A(外观/状态)与角色 B(外观/状态)面对面。镜头先给(环境/双人中景),随后切到角色 A 近景,A 用(情绪)语气说:“(台词 1)”。角色 B 停顿(动作),切到 B 近景,B 回答:“(台词 2)”。最后镜头(推近/拉远/定格)呈现两人的情绪变化。表情自然,口型同步,电影感光影,不要字幕,不要 logo。

电商口播模板

适合美妆、食品、家居、数码种草。

固定机位,近景镜头,(清新自然/专业直播/居家种草)风格。图片 1 中的主播面带笑容,向镜头介绍图片 2 中的(产品)。主播先把产品展示给镜头,说:“(开场卖点)”;接着演示(使用动作/质地/功能),说:“(核心卖点)”;最后给出使用后的效果或情绪反馈,说:“(收尾文案)”。人物居中,产品清晰,口型同步,纯净无字幕,不要 logo。

商品展示模板

适合单品质感展示和广告素材。

背景为(桌面/展台/户外场景),中景呈现图片 1 中的(商品)。镜头平稳推近到商品近景,一只手自然入镜,轻轻拿起商品并缓慢旋转,展示(材质/结构/标识/功能细节)。随后镜头切到(特写卖点),光线柔和干净,商品边缘清晰,反光自然,画面高级真实,不要字幕,不要 logo。

可控文字模板

适合短词标题、对白气泡、品牌露出。

在(场景)中生成准确文字“(短词/品牌名)”。文字出现在(位置),材质为(液态水流/霓虹灯/纸张印刷/白色圆角气泡),颜色为(颜色),出现时机为(第几秒/角色说话时/镜头推近后)。文字不遮挡主体,边缘清晰,跟随镜头稳定运动,除指定文字外不要额外字幕,不要 logo。

复杂运镜模板

适合 FPV、一镜到底、超现实转场。

(城市/室内/自然场景)中的一镜到底视频。镜头从(起点和景别)开始,以(速度)向(方向)运动;第 1 段:(贴地/推近/环绕/抬升)经过(关键物件);第 2 段:通过(动作/物件/光效)触发转场,进入(新空间);第 3 段:镜头(翻转/下坠/穿越/拉远)并最终落到(终点画面)。每段运动方向明确,转场自然,画面真实稳定,不要字幕,不要 logo。