你知道图像生成是如何从模糊的32x32纹理块发展到几乎在一瞬间就难以与真实图像区分的高分辨率图像的吗?同样的事情现在正沿着时间轴(扩展到视频)发生,其影响令人有些难以置信。每个人都成为多模态梦想的导演,就像《盗梦空间》中的建筑师。
回到现实片刻,图像/视频生成与需要大量数据的神经网络完美匹配,因为数据丰富,每张图像或视频的像素都是网络参数的大量比特(软约束)来源。当你在监督丰富的环境中训练巨型神经网络时,训练损失等于验证损失,生活如此美好。
目前我最喜欢关注AI视频领域发展的地方可能是 https://t.co/l1xRaq71C4 ,或者各个Discord服务器。