Testei três modelos multimodais pequenos no Ollama para interpretar imagens: MiniCPM-V 4.6, Qwen 3.5 2B e Qwen3-VL 2B.
A ideia era encontrar algo leve o suficiente para futuramente rodar em uma VPS com 8 GB de RAM e usar no blog para gerar descrições de imagens, ajudar na acessibilidade e até tentar interpretar textos em pôsteres estrangeiros.
Resumo rápido
| Modelo | Tamanho aproximado | Resultado no teste |
|---|---|---|
| MiniCPM-V 4.6 | 1,6 GB | Rápido, mas descrição mais fraca |
| Qwen 3.5 2B | 2,7 GB | Rápido e mais detalhado |
| Qwen3-VL 2B | 1,9 GB | Bom resultado, mas bem mais lento |
Como instalar e usar
Se você já tem o Ollama instalado, não precisa configurar praticamente nada. Basta executar o modelo:
MiniCPM-V 4.6
ollama run minicpm-v4.6
Qwen 3.5 2B
ollama run qwen3.5:2b
Qwen3-VL 2B
ollama run qwen3-vl:2b
Depois que o chat abrir no terminal, você pode simplesmente arrastar uma imagem para a janela e escrever sua pergunta.
Por exemplo:
'/home/usuario/Downloads/imagem.webp' "O que aparece nesta imagem?"
O Ollama detecta o arquivo e envia a imagem junto com o prompt para o modelo.
Imagem usada no teste
Para comparar os três modelos, usei o mesmo pôster de anime em todos os testes. A imagem possui dois personagens, vários textos em japonês e um pequeno cartaz dentro da própria ilustração.
Ou seja: é um teste interessante porque envolve não apenas reconhecer pessoas, roupas e cenário, mas também tentar entender texto dentro da imagem.
Foi um teste simples, usando praticamente a mesma pergunta direta para os modelos. Com um prompt um pouco mais elaborado, talvez os resultados fossem melhores. Ainda assim, por serem modelos pequenos, também não faria sentido exagerar na quantidade de instruções, já que prompts muito complexos podem aumentar a chance de o modelo se confundir ou alucinar informações.
1. MiniCPM-V 4.6
ollama run minicpm-v4.6
Também desativei o modo de raciocínio:
/set nothink
Prompt:
"O que aparece nesta imagem?"
O MiniCPM foi rápido, mas teve o pior resultado dos três no meu teste.
Ele identificou corretamente que era uma imagem no estilo anime e percebeu que havia dois personagens e texto japonês, mas a descrição ficou bastante genérica.
Também misturou palavras em inglês na resposta e não conseguiu interpretar muito bem o conteúdo escrito no pôster.
Ponto positivo: foi leve e rápido.
Ponto negativo: qualidade da descrição abaixo dos Qwen.
2. Qwen 3.5 2B
ollama run qwen3.5:2b
Novamente:
/set nothink
O Qwen 3.5 foi bem mais detalhado.
Ele identificou os dois personagens, características das roupas, expressões, estilo da imagem e também tentou ler e traduzir os textos japoneses.
Nem tudo estava correto. O modelo chegou a interpretar o texto como algo relacionado a basquete, o que não corresponde necessariamente ao conteúdo real da imagem.
Mesmo assim, entre velocidade e quantidade de informação, foi o resultado que mais me agradou.
Ponto positivo: rápido e bastante detalhado.
Ponto negativo: pode inventar interpretações quando não consegue ler o texto corretamente.
3. Qwen3-VL 2B
ollama run qwen3-vl:2b
Esse era o modelo que eu já tinha testado anteriormente.
A descrição visual foi boa. Ele reconheceu os personagens, o cenário, o estilo de anime e inclusive conseguiu identificar corretamente o texto 「アニメ化決定!」 no cartaz menor.
O problema foi a velocidade.
Mesmo usando:
/set nothink
o modelo continuou entrando no modo de raciocínio e exibindo:
Thinking...
<think>
...
</think>
Na prática, ele demorou consideravelmente mais para responder do que os outros dois.
Ponto positivo: boa compreensão visual.
Ponto negativo: foi claramente o mais lento no meu teste.
Máquina usada
Os testes foram feitos em um Samsung Galaxy Book 4 com:
- Intel Core i7 de 12ª geração;
- 16 GB de RAM;
- sem placa de vídeo dedicada.
Ou seja, toda a inferência foi feita sem uma GPU dedicada.
MiniCPM-V 4.6 e Qwen 3.5 2B responderam relativamente rápido. O Qwen3-VL 2B foi o único que demorou bastante.
Qual eu usaria?
Depois desse teste, minha primeira escolha seria o Qwen 3.5 2B.
Ele não foi perfeito, principalmente na tradução do japonês, mas conseguiu entregar uma descrição bem mais completa sem ficar lento demais.
O MiniCPM-V 4.6 pode ser interessante quando consumo de memória e velocidade forem mais importantes que precisão.
Já o Qwen3-VL 2B continua sendo uma opção boa, mas no meu computador ficou difícil justificar a demora em relação aos outros dois.
Meu objetivo: descrições automáticas no blog
A ideia desses testes não é simplesmente conversar com uma imagem pelo terminal.
Estou pensando em criar um job no blog que analise automaticamente as imagens das postagens e gere uma descrição complementar.
Isso poderia ser útil principalmente em dois casos:
- melhorar a acessibilidade para pessoas que utilizam leitores de tela;
- explicar ou traduzir textos presentes em pôsteres, capas e imagens estrangeiras.
Para imagens japonesas, por exemplo, normalmente é preciso abrir outro aplicativo, enviar a imagem e pedir uma tradução manualmente.
Se um modelo pequeno conseguir fazer isso automaticamente durante a publicação do post, o processo fica bem mais interessante.
Comandos rápidos
# MiniCPM-V 4.6
ollama run minicpm-v4.6
# Qwen 3.5 2B
ollama run qwen3.5:2b
# Qwen3-VL 2B
ollama run qwen3-vl:2b
Depois é só arrastar uma imagem para o terminal, escrever o prompt e pressionar Enter.