avatar
Brando ZHANG
🧑🏻‍💻 GenAI SDE@TikTok/ByteDance | 🔬 Ex-Research Engineer@Ant/Alibaba

我目前在 ByteDance 做生成式 AI 软件工程,主要把生成和多模态模型接入创作工具:图像与视频生成、内容理解、长任务处理,以及支撑这些能力的服务系统。

我最早从计算机图形学和三维视觉进入这个方向。2023 年,我从南加州大学获得计算机科学硕士学位;本科就读于香港中文大学(深圳)计算机科学与工程专业。此前,我曾在 TikTok/ByteDance 和蚂蚁集团做生成模型相关研究,也在深圳市大数据研究院参与单视图三维重建研究。

现在我更关心模型离开论文和 Demo 之后会遇到的事:接口是否清楚、长任务能否恢复、评估是否可信、出了问题能不能看明白。一个模型有潜力只是开始;把它做成能稳定服务创作者的系统,才是另一段很长的工程。

这个博客最初记录的是图形学和深度学习学习笔记,这些内容会继续保留。之后我也会写一些从研究原型走向创作型 AI 系统时,反复遇到的工程问题和判断。

现在关心的方向

  • 生成式与多模态 AI 系统
  • 创作工具、图形学与人机交互
  • 可靠的推理服务与工作流编排
  • 让 AI 能力更容易组合和评估的工具

代表工作

One-Shot Generative Domain Adaptation(GenDA)

GenDA teaser

GenDA 研究如何只用极少量、甚至一张目标域图片,将预训练 GAN 迁移到新的图像域。这项工作完成于我在 TikTok/ByteDance 的实习期间,合作导师为沈宇军博士杨策源博士

[论文] [代码]

VIPNet:单视图三维重建

VIPNet 通过稀疏隐式点引导,从单张图片重建高分辨率三维形状,发表于 3DV 2020。

[项目页]

C++ 三维图形渲染器

旋转的渲染样例

我写过一个轻量的 OpenGL 风格渲染器,用来理解从三维模型到图像的完整路径:光栅化、变换、着色、纹理和抗锯齿。

[代码]

个人创作

工作以外,我也喜欢画画和做视觉设计。

早餐海报

早餐海报

这张海报是为校园早餐活动画的。“早点来吧”既是喊大家早些到,也是在邀请大家来吃早餐。

STAr Logo

这个 Logo 为 Sailboat Test Arena(STAr)项目设计,用于测试和引导自动帆船。北斗七星既指向航行,也呼应了项目名称。