Processamento de entradas multimodais usando modelos de linguagem

processamento de entradas multimodais usando modelos de linguagem. métodos, sistemas e aparelhos, incluindo programas de computador codificados em meios de armazenamento de computador, para processamento de entradas multimodais utilizando modelos de linguagem. em particular, as entradas incluem uma...

Ausführliche Beschreibung

Gespeichert in:
Bibliographische Detailangaben
Hauptverfasser: MARIA RAFAILIA TSIMPOUKELLI, CABI SERKAN, JACOB LEE MENICK, VINYALS ORIOL, SEYED MOHAMMADALI ESLAMI, FELIX GEORGE HILL
Format: Patent
Sprache:por
Schlagworte:
Online-Zugang:Volltext bestellen
Tags: Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
Beschreibung
Zusammenfassung:processamento de entradas multimodais usando modelos de linguagem. métodos, sistemas e aparelhos, incluindo programas de computador codificados em meios de armazenamento de computador, para processamento de entradas multimodais utilizando modelos de linguagem. em particular, as entradas incluem uma imagem, e a imagem é codificada por uma rede de codificador de imagem para gerar uma sequência de incorporações de imagem que representam a imagem. a sequência de incorporações de imagem é fornecida como pelo menos parte de uma sequência de entrada que é processada por uma rede neural de modelo de linguagem. Methods, systems, and apparatus, including computer programs encoded on computer storage media, for processing multi-modal inputs using language models. In particular, the inputs include an image, and the image is encoded by an image encoder neural network to generate a sequence of image embeddings representing the image. The sequence of image embeddings is provided as at least part of an input sequence to that is processed by a language model neural network.