研究出一种更加厉害的基础架构。
\n
当然了,这在上辈子完全就是幻想。
\n
所以平时有空的时候他就会抽出时间思考这个问题,所以邱彦他们经常能看到周昀独自一个人坐在位置上发呆,而且一坐就是几个小时。
\n
但哪怕他觉得自己现在已经足够聪明,可是经过近半年的思考,他还是没能想到什么全新的架构,终究还是被束缚在transform的框架之下。
\n
不过他也没有气馁,毕竟这东西要是研究出来,说一句名垂千古都不为过。
\n
更何况他还年轻。
\n
既然新的架构不行,就只能从他熟悉的两个领域入手了。
\n
他的手指一顿,突然想到了一个非常好的选题,如果能做出来,贡献也绝对是巨大的。
\n
这个选题就是——多模态融合中的最优传输理论。
\n
多模态学习的核心是如何将不同模态(视觉、语言)的特征空间对齐,当前的方法通常使用的是交叉注意力机制,甚至是更为简单的点积或余弦相似度。
\n
而最优传输(optimaltransport,ot)是一种数学理论,致力于寻找将质量或概率从一种构型转移到另一种构型的最有效方式,从而最小化给定的成本。
\n
他的想法就是将对齐问题建模为ot问题,当然,这个ot问题肯定会非常难,因为每一个特征的维度都是非常高的,而多模态的特征又非常多。
\n
所以他就联想到了人类的大脑,人脑在处理不同感官信息(视觉、听觉、触觉)时,似乎在底层存在着一种统一的“意识流”,
\n
各种模态的信息涌入后,被映射并在这个流中进行交换、融合和理解,比如闻着榴莲吃
本章未完,请点击下一页继续阅读! 第3页 / 共4页