Pesquisadores da Universidade de Zhejiang desenvolvem Sistema de Raciocínio Visual, permitindo que robôs processem informações 22 vezes mais rápido que a leitura convencional.
Cientistas da Universidade de Zhejiang, em parceria com instituições como a Universidade Cornell, a Universidade Nacional de Singapura e a Universidade Xidian, criaram um sistema revolucionário de raciocínio visual que permite que robôs utilizem sua visão para pensar, ao invés de dependerem de monólogos internos baseados em linguagem.
Denominado VisualThink-VLA, o sistema demonstra uma notável melhoria em termos de velocidade, sendo 22,8 vezes mais rápido do que métodos tradicionais que utilizam raciocínio textual, ao mesmo tempo que oferece uma precisão superior.
A premissa essencial do VisualThink-VLA é que os modelos convencionais Vision-Language-Action se baseiam em um raciocínio sequencial por texto. Nessa abordagem, o robô compõe um esboço interno para cada ação antes de executá-la...










