计算机视觉与多模态学习

沈飞鸿Feihong Shen

关注多模态大模型,计算机视觉,aigc,探索机器如何理解、检索与生成视觉内容。

fhshen2022@gmail.com 杭州,中国
沈飞鸿在西藏羊卓雍措
羊卓雍措,西藏

01 / 关于

让视觉智能真正解决问题。

我目前于字节跳动担任多模态大模型算法工程师。2025年于东南大学获得软件工程硕士学位,硕士期间在PALM 实验室学习,师从陈浩教授;2022年于东南大学获得人工智能学士学位。

我的工作与研究涵盖多模态大模型、多模态内容理解、AIGC、自监督学习,RGB-D感知。

  • 多模态大模型
  • AIGC
  • 计算机视觉
  • 自监督学习

02 / 工作经历

工程与研究

字节跳动 Logo

2025年6月 - 至今

多模态大模型算法工程师

抖音电商,字节跳动 · 杭州

  • 升级视频同款商品链路,包括视频商品图识别、视频/商品大模型 embedding 召回,以及视频-商品同款判别精排。
  • 负责广告素材爆款复刻链路中的商品找视频 RAG 链路,并训练广告后验预估模型。

2024年7月 - 2024年10月

计算机视觉算法实习生

通义实验室,阿里巴巴集团 · 杭州

基于扩散模型,研究图生视频任务中的可控相机运动生成。

03 / 教育经历

东南大学

东南大学校徽

2022 - 2025

软件工程硕士

计算机科学与工程学院

  • 思特奇未来之星一等奖学金,2024
  • 东南大学二等奖学金,2022、2023
  • 中国研究生数学建模竞赛二等奖,2022
  • 计算机视觉课程助教,2022年秋季学期

2018 - 2022

人工智能学士

计算机科学与工程学院

  • GPA:3.8 / 4.0 · 专业排名:24 / 86
  • 计算机科学与工程学院三好学生

04 / 代表工作

学术论文

围绕多模态视觉理解与内容感知生成展开研究。

02
NeurIPS 2024CCF A

Prune and Repaint: Content-Aware Image Retargeting for Any Ratio

Feihong Shen,Chao Li,Yifeng Geng,Yongjian Deng,Hao Chen

结合语义接缝裁剪、自适应重绘与图像扩展,在任意目标宽高比下尽可能保留显著内容并减少裁剪伪影。

03
Information Fusion 2025JCR Q1

Modality-Balanced Contrastive Learning for RGB-D Salient Object Detection

Hao Chen,Feihong Shen,Lichuang Zhang

通过模态平衡对比学习提升 RGB 与深度模态的特征提取和融合能力,并将框架扩展至 RGB-T 感知任务。

05 / 个人项目

去码头
整点薯条。