@rodrigotadewald: Projetos como este são úteis em casos onde você precisa organizar centenas de imagens ou documentos por tags e conseguir buscar no futuro de maneira eficiente… mas não quer categoriza-los um a um. O que fiz foi utilizar um modelo de embedding multimodal para “transformar” imagens em números e guardá-los em um banco de dados apropriado. Assim, no futuro posso buscar por imagens parecidas utilizando como chave de busca outras imagens e textos, que também serão convertidos em números. Essa inclusive é a lógica por trás de como os modelos de linguagem (como ChatGPT e Gemini) “entendem” textos e imagens. O que fiz foi apenas “extrair” esse motor de tradução deles. (Parece difícil, mas tudo isto nós ensinamos em poucas horas dentro dos cursos de IA da Asimov 🤓) Assim, imagens que contém relações semânticas semelhantes estarão mais “próximas” numericamente entre si (um carro terá sua representação parecida de outro carro, por exemplo). E tudo isso ocorre automaticamente, sem a necessidade de termos que categorizar imagens e documentos na mão! Qualquer dúvida, deixe nos comentários. #ia #photoshop @Asimov Academy @Aline