Microduck: robô bípede de US$ 399 da Pollen Robotics e Hugging Face permite treinar movimentos com aprendizado por reforço
A Pollen Robotics, equipe de robótica de Bordeaux integrada à Hugging Face, abriu nesta semana as pré-encomendas do Microduck, um pequeno robô bípede de 25 centímetros cujo diferencial está em tornar público todo o processo de treinamento de seus comportamentos. Com preço de US$ 399, o aparelho chega ao mercado com a proposta de entregar não apenas um produto pronto, mas o ciclo completo de desenvolvimento de políticas neurais, desde a simulação física até a execução no hardware.
Cada movimento executado pelo Microduck, como andar, sentar, chutar, patinar ou se levantar após uma queda, é resultado de uma política neural, ou seja, um modelo de inteligência artificial treinado em um simulador de física e depois exportado para o robô real. Os ambientes de treinamento, as funções de recompensa, as configurações de randomização de domínio e a chamada receita sim-to-real, que adapta o que foi aprendido na simulação para o mundo real, estão disponíveis publicamente no GitHub, permitindo que desenvolvedores e pesquisadores reproduzam, modifiquem e criem novos comportamentos.
O Microduck sucede o Reachy Mini, modelo anterior da Pollen que já ultrapassou a marca de 10 mil unidades vendidas. A proposta, porém, se inverte: enquanto o Reachy Mini foi pensado para ficar sobre uma mesa e interagir com o usuário, o Microduck foi projetado justamente para sair da mesa, cair e aprender a se reerguer.
No quesito hardware, o robô mede 25 centímetros de altura por 14 centímetros de largura e pesa menos de 800 gramas. São 15 motores distribuídos entre pernas, pescoço e cabeça, além de um bico articulado capaz de pegar objetos do chão. O processamento fica por conta de um chip Rockchip RK3566, acompanhado de um acelerador de inteligência artificial, 1 GB de memória RAM e 32 GB de armazenamento.
A lista de sensores é considerada ampla para a faixa de preço. O Microduck conta com uma câmera frontal acompanhada de um indicador luminoso dedicado de uso, duas unidades de medição inercial (IMUs), sendo uma no corpo e outra na cabeça, e um sensor LiDAR compacto baseado em uma matriz 8x8 de tempo de voo, tecnologia que mede distâncias por meio do tempo que a luz leva para retornar ao sensor. O conjunto inclui ainda microfones, alto-falante, duas antenas NFC, além de conectividade Wi-Fi e Bluetooth. A bateria removível do tipo NP-F550, com 2.600 mAh, oferece autonomia aproximada de uma hora.
Na caixa, o robô já vem com sete movimentos treinados que podem ser acionados por um controle de videogame incluso, antes mesmo de o usuário escrever qualquer linha de código: andar, sentar e levantar, chutar, pegar objetos, patinar e recuperação após queda. O robô não fala, mas cada unidade gera sua própria identidade sonora na primeira inicialização e a mantém permanentemente.
O treinamento das políticas acontece no ambiente microduck_rl, construído sobre o mjlab, que utiliza o MuJoCo Warp como motor de simulação física, e o algoritmo PPO, uma técnica de aprendizado por reforço bastante usada em robótica. A Pollen Robotics informa que uma marcha útil pode ser obtida em cerca de uma a duas horas de treinamento em uma GPU compatível com CUDA, executando 4.096 ambientes em paralelo. Quem não possui uma GPU local pode enviar o mesmo comando com o parâmetro --hf-jobs para rodar na infraestrutura Hugging Face Jobs.
Um dos pontos centrais do trabalho de adaptação entre simulação e robô real está no modelo dos atuadores. Cada servo utiliza o modelo BAM M6 do Dynamixel XL330, que considera a lei de controle por tensão, a força contraeletromotriz e atritos do tipo Coulomb, Stribeck e dependente da carga, em vez de um controlador PD ideal. A randomização por ambiente abrange variações de tensão da bateria, queda de tensão sob carga, atraso de comandos e magnitude do atrito. Também são aplicados cenários com folga de engrenagens de ±1°, totalizando 2°, em cada uma das 14 juntas servomotoras presentes no layout de aprendizado por reforço.
As políticas treinadas são exportadas para o formato ONNX, com o normalizador de observações já integrado ao grafo do modelo, e a Pollen Robotics alerta que não se deve usar versões convertidas manualmente. No robô, um runtime escrito em Rust opera o loop de controle a 50 Hz e gerencia o barramento dos motores. Todas as políticas compartilham uma observação de 61 dimensões, sendo 48 de propriocepção, ou seja, dados sobre o próprio estado do robô, e 13 comandos divididos entre torção do corpo, pose da cabeça e pose do corpo.
O repositório público reúne 13 tarefas, incluindo rastreamento de velocidade, levantar, sentar e levantar, coleta de objetos do chão, chute de bola com esfera de 70 milímetros e 15 gramas na qual o ator não enxerga a bola, rolamento e cinco ambientes voltados à patinação. O software do Microduck é distribuído sob a licença Apache 2.0, embora os arquivos de design mecânico e eletrônico não sejam abertos.
Com pré-encomendas abertas em 27 de agosto de 2026 e entregas previstas antes do Natal, o Microduck representa mais um passo da Hugging Face para levar a inteligência artificial de código aberto além do software e dentro de máquinas físicas.