听到要求立即答应:
“虽然没有研究纯视觉模型的人,但多模态大模型大都可以处理图像。”
“比如CLIP、DALL-E、Flamingo、PaLM-E、GPT-4V……”
“如果用的是大模型的话,我们组有很多人听你号令。”
“我这就带人过来……”
“有啥指示,尽管提!”
在傅宏的嘱咐下,新来的专家袁天佑十分配合,仔细研究王霁发的Github项目,3小时后订会议室当面答复:
“老板,关于这部分代码,我整理了一个文档,跟您汇报一下。”
“这个项目主要用COCO和ImageNet做训练数据集……”
“还有部分自采数据,但不知什么原因,自采数据量小很多。”
“COCO和ImageNet以高光环境为主,低光场景的数据很少,加上自采集的不够,可能会影响低光推理效果。”
“我建议可以用ExDark或LOL,这是低光数据集,拿来做微调。”
“另外,低光环境下单图噪点多,可以用UNet/GAN进行增强。”
“还有,在增强前可以考虑多帧融合,会比现在好些。”
王霁:“……”
妈耶,听不懂!
大体的思路是明白的,但一堆名词根本记不住。
袁天佑不是那种木头木脑的IT男,一下子就反应过来:
“老板,宏哥说了,我这两天听您吩咐!”
“您指哪,我就打哪!”
“这样吧,我把刚才说的建议整理成个文档,详细描述下。”
“还有,能够直接修改的地方,我提个PR,顺手改掉。”
“其实项目开发者很有实力的,光是点子我就觉得很有意义,只是不知道为什么,注释很啰嗦,奇怪……”
他说干就干,当真用两天时间,凭经验改了部分代码,提交PR。