DreamPaper 面向论文技术路线图、组会汇报和答辩演示等场景,重点不是让单一生图模型自由发挥,而是用模板、材料和角色分工约束生成过程。最终目标是让图的内容组织、视觉风格和现实素材更稳定,同时保留人工审阅与自定义空间。
它解决的三个问题
科研制图常见的困难不只是“不会画”,还包括技术路线没有清晰版式、演示文稿缺少统一设计语言,以及生成式图片在风格和内容密度上波动较大。DreamPaper 将这些问题拆成规划、实现和素材检索三个环节,试图把一次不可控的生成变成可检查的流水线。
三类模型如何协作
1. Design model:理解与编排
规划模型读取用户提供的论文材料、参考图片和模板,提炼目标内容并安排布局,最后生成交给制图模型的描述。由于需要理解图片,这个模型必须支持多模态输入;项目兼容 OpenAI 与 Anthropic 风格协议。
2. Implement model:执行制图
制图模型接收已经组织好的设计描述,负责产生最终图片。它不承担所有事实判断与结构设计,而是尽量专注于视觉实现。这种分工能减少“边理解、边规划、边绘制”造成的随机性,但最终质量仍取决于所选模型。
3. Search model:补充现实素材
搜索模型从材料中识别硬件、软件产品等现实对象,再寻找可用于规划的真实素材,帮助设计模型减少凭空编造并提高信息丰富度。这里仍需人工确认素材版权、引用条件和事实准确性;原帖未说明自动完成授权核验,因此不能把“检索到”视为“可直接用于论文”。
一次典型使用流程
可以按下面的顺序理解这套工作流:
- 准备论文摘要、方法描述、关键数据和必须出现的对象。
- 选择接近目标风格的模板,并填写标题、方法说明、比例及布局约束。
- 配置支持图像输入的 design model,再分别配置 implement model 与 search model。
- 让规划模型先产出内容和版式方案,检查逻辑与术语后再进入制图。
- 对结果进行事实、文字、单位、图例和素材许可审查;科研图不能只以“看起来合理”为验收标准。
- 在论文、答辩或组会中使用前,按期刊、学校或课题组规范统一字体、配色与引用。
项目提供轻量桌面端和本地 WebUI,可从 Release 页面下载。所谓“本地”主要指应用运行方式;调用外部模型时,材料仍可能发送给相应 API 服务,敏感或未公开研究资料应先确认数据处理条款。
常见错误与排查
社区中有人遇到 Unsupported content type。作者给出的判断是:design model 只需要完成图文理解,不需要额外的工具列表;出现该错误时,应先检查上游接口是否真正支持图片输入,以及请求格式是否符合其多模态文档。
Windows 端曾出现模板图片无法显示的问题,作者在后续更新中修复并优化了流畅度。遇到模板异常时,可先确认模板相关文件是否完整导入,再使用最新发布版复测。
适用边界
这套方案更适合技术路线图、科研汇报和具有明确模板约束的演示文稿。作者也说明,当前风格主要来自自己的组内实践,泛化到其他类型 PPT 不一定合适。它不能替代科研事实核查、图表数据计算、版权判断或最终排版审校;原帖也没有给出系统化质量基准,因此应把生成结果视为可迭代初稿,而不是可直接投稿的成品。
可复用的经验在于:把视觉任务拆成“内容规划—素材核验—视觉实现”,比单次提示词更容易定位问题,也更便于替换其中任一模型。
原作者:MILD
原帖:https://linux.do/t/topic/2735188