Problemas con el modelo CLIP (IA)
Budget: €8 – €30 EUR
Estoy desarrollando un codigo que dada una imagen que un UI (interfaz web o interfaz de windows,linux etc) y una descripcion del elemento a buscar, obtenga las coordenadas centrales del elemento, por ejemplo para la pagina web de facebook, dada la descripcion "boton de registro" o "campo de texto nombre", devuelva la posicion exacta de los elementos, hasta ahora he desarrollado la parte mas basica, pero parece ser que ahora le pongas el input que le pongas siempre da como resultado el campo de registro. Ajunto las capturas y el codigo. Se requiere que se detecte cualquier elemento de la UI dado una descripcion del mismo y devuelva las coordenadas.