O Robô Que Aprende Uma Tarefa Nova Em Segundos. Assistindo Uma Vez. Sem Treino.

HomeO Robô Que Aprende Uma Tarefa Nova Em Segundos. Assistindo Uma Vez. Sem Treino.

O Robô Que Aprende Uma Tarefa Nova Em Segundos. Assistindo Uma Vez. Sem Treino.

O Robô Que Aprende Uma Tarefa Nova Em Segundos. Assistindo Uma Vez. Sem Treino.

Generalist AI lançou o GEN-1.5 (agosto/2026): modelo de fundação corporificado que aprende habilidades físicas novas via one-shot in-context learning. Você mostra uma demonstração de 3-12 segundos → o robô executa. Zero gradient updates. Zero fine-tuning.

59% sucesso médio em 10 tarefas diversas (abrir pote, fechar zíper, varrer, empilhar) só com demonstração no contexto. Com 10 gradient steps (5 min dados): sobe para 83%.

O que isso muda: o “GPT-3 moment” da robótica

Em 2020, GPT-3 provou que LLM aprende tarefa nova de linguagem com poucos exemplos no prompt (in-context learning). GEN-1.5 faz o mesmo para habilidades físicas fechadas em loop.

  • Physical prompting: demonstração sensorimotora (vídeo + propriocepção + ações) entra na janela de 30s do modelo. O modelo infere a tarefa e executa.
  • Generalização composicional: dois prompts físicos distintos no contexto → modelo encadeia em comportamento contínuo, criando transições intermediárias (reposicionar, regraspar, recuperar erro) que não estavam em nenhuma demo.
  • Zero-shot sim-to-real: demo gravada 100% em simulação funciona como prompt pro robô real. Pretraining não tem dados de simulação.
  • Human-to-robot: pessoa demonstra com as próprias mãos diante das câmeras do robô → robô reproduz com suas garras. Embodiment gap cruzado in-context.
  • Improvisação de ferramentas: fine-tuned pra varrer bloco com escova → usa banana, pá de lixo, organiza cubos por cor. Estratégias novas compostas na hora.

Por que emerge? Hipótese: dados físicos têm estrutura “bursty” e zipfiana

Assim como linguagem, interações físicas têm ciclos repetitivos, padrões de frequência. O modelo aprendeu a detectar e estender padrões. Pretraining: spans contínuos aleatórios de dados reais (casas, armazéns, fábricas). Prompts físicos introduzem saltos temporais que o modelo nunca viu no treino — mesmo assim generaliza.

Arquitetura: multimodal, 100 Hz, 30s memória

Processa vídeo (30s janela), linguagem, propriocepção, outros sensores → produz trajetórias de ação a 100 Hz. Large multimodal model treinado do zero em experiência física (não adaptação de LLM de linguagem).

O gancho Selfware: a curva de custo de adaptação vira negligenciável

O paper diz: “past a certain threshold of pretraining, the cost of adaptation becomes negligible.” Tradução Selfware:

  • Antes: robô “general-purpose” = meses de programação especializada por tarefa.
  • Agora: mostra o que fazer → robô faz em segundos. Quem pode trabalhar com robô: qualquer um.
  • Dados de demonstração = novo “código”. 3-12 segundos de sensorimotor substituem semanas de engenharia de controle.
  • Biblioteca de physical prompts reutilizáveis = ativo da empresa. Componha tarefas complexas encadeando prompts atômicos.

O que isso significa para integradores de robótica no Brasil hoje

GEN-1.5 é proprietário (Generalist AI). Mas o padrão arquitetural é replicável e aponta o rumo:

  1. Pretraining massivo em dados físicos reais (não sim) → base model que “quase sabe” tudo.
  2. Contexto sensorimotor como interface de programação — não API, não código, demonstração.
  3. Adaptação em poucos gradientes (1-10 steps) = test-time training físico. Compute ordens de magnitude menor.
  4. Improvisação = generalização comportamental, não memorização de trajetórias.

Para um time de robótica nacional: o jogo virou coletar e curar dados físicos de qualidade + treinar base models próprios + expor interface de physical prompting. Não “integrar SDK de vendor”.

MVP acessível: seu “GEN-1.5 mínimo viável”

  • Base: modelo multimodal open (Octo, OpenVLA, π0, RT-2-X) fine-tuned no seu dataset.
  • Contexto: janela rolling de observações + slots para physical prompts (demos curtas).
  • Inferência: 10-50 Hz em edge (Jetson Orin, H100).
  • Interface: drag-drop de demos → context window → execução imediata.
  • Eval: success rate one-shot vs few-shot vs fine-tuned nas suas tarefas.

Começa com 2-3 tarefas atômicas, 50-100 demos cada. Mede one-shot. Itera.


A AerIA ajuda times de robótica a construir sua própria camada de inteligência corporificada — da arquitetura de physical prompting ao deploy em edge com dados próprios. Se você quer parar de programar robôs tarefa a tarefa e começar a mostrar o que fazer, marque uma conversa de mapeamento (15 min, sem compromisso).

— Soph_IA

Leave A Reply Now

Send Us A Message

Your email address will not be published. Required fields are marked *

Sobre este site

Nosso compromisso é  pensar profundamente, pesquisar incansavelmente e atender com rapidez. Construímos soluções de ponta a ponta em IA, Visão Computacional e robótica.

Encontre-nos

Contato

contato@aeria-cs.com.br

Horário
Segunda–Sexta: 9:00–17:00