致力于探索把视频生成与开放域内容的主观好坏,拆成可量化、可复核、可回流模型迭代的评测标准。
Beijing, CN
我是袁梦,AI 模型评测 / AI 训练师,多模态方向。评测这条线我是从数据里一层层做上来的:先在网易做游戏 NPC 对话与 SFT / RLHF / RAG 训练数据,现在在热热科技沿「训练数据 → 提效工具 → 模型横评 → 系统级评测」,一路推进到短剧生成智能体的端到端评测。我懂影视视听语言,也常用 AIGC 工具自己动手创作——用创作者的眼睛摸过模型的能力边界,评起来才知道分寸在哪。
查看简历
视频标注 Lab
邮箱已复制
I evaluate multimodal systems
多模态评测
AI 训练师(多模态方向)
@ 热热科技
2025.04 – 至今

多模态视频生成场景的评测与数据标准化,覆盖训练数据、提效工具、模型横评和短剧生成智能体系统级评测。

AI 训练师(实习)
@ 网易
2024.09 – 2025.04

参与游戏智能 NPC 角色扮演对话与游戏内搜索 / 问答训练数据建设,覆盖 SFT、RLHF 偏好排序与 RAG 检索相关性。

创意文化产业 硕士文凭(PGDip)
@ 曼彻斯特大学
2023.09 – 2024.11
教育学 学士
@ 曼彻斯特大学
2020.09 – 2023.06
I love shows
机器人之梦
动画 · 剧情
电影
一只狗和一个机器人的友谊,全片没有一句台词。
完美的日子
剧情 · 维姆·文德斯
电影
东京公厕清洁工的日常:重复的日子里,每一天都不一样。
伦敦生活
喜剧 · 剧情
剧集
Phoebe Waller-Bridge 自编自演,对着镜头打破第四面墙。
摇滚莫扎特
摇滚音乐剧
舞台剧
把莫扎特的一生唱成摇滚的法语音乐剧。
See full list
I live for music
Games keep me curious
艾尔登法环 · Elden Ring
塞尔达传说 旷野之息 · Breath of the Wild
崩坏:星穹铁道 · Honkai: Star Rail
无畏契约 · VALORANT
你怎么评估一个端到端短剧生成智能体?
我会先把一句话创意到完整短剧拆成六个阶段:故事规划、分镜脚本、视觉生成、跨片段连续、后期组装和生产结论。每个阶段有独立评分维度和阶段门槛,失败样本能定位到具体环节,再把归因回流给算法侧。
短剧多镜头模型横评最关键看什么?
除了单条视频质量,我更看跨镜头一致性、脚本对齐、运动质量和成本口径。多模型同题生成后,用镜头级提示词、相邻镜头对和红线一票否决做横评,最后给出可用率和性价比双口径的底座选型建议。
你怎么把主观审美拆成打分卡?
我会从影视视听语言入手,把景别、运镜、构图、光影、节奏和表演叙事拆成可观察的锚点,再给正反例和边界样本。这样「好不好看」不只停留在感受,而能被多人复核和稳定交付。
自动化工作流在评测里承担什么角色?
机器适合做重复初筛、结构化解析、分差预警和数据看板;人工负责判断、仲裁和终审。我用 Dify、Python 和离线插件把关键帧抽取、机标初评、人工精评串起来,让人均产能提升,同时保留质量控制权。
网易实习经历怎么补足这条能力线?
网易项目让我完整接触 SFT 对话编写与改写、RLHF 偏好排序、RAG 检索相关性和 badcase 归因。它补足了「训练数据如何回流模型」这一段,也让我更清楚角色一致性、世界观约束和事实性问题在数据层怎么处理。
Q&A