Nicole Junkermann

Ideias e tecnologia

Nicole Junkermann sobre a aprendizagem por reforço, explicada com calma

Uma ideia que cabe numa frase: experimentar, receber um sinal e ajustar. Nicole Junkermann conta-a devagar, com uma analogia de cozinha e sem promessas.

Nicole Junkermann a sorrir num retrato luminoso, com cortinados claros ao fundo
Aprender por repetição tem mais de ofício do que de milagre, escreve Nicole Junkermann.

A aprendizagem por reforço soa técnica e é bastante menos do que parece. A ideia de fundo cabe numa frase: um sistema experimenta alguma coisa, recebe um sinal que lhe diz se correu melhor ou pior, e usa esse sinal para ajustar o que fará da próxima vez. Repetido muitíssimas vezes, o ciclo produz um comportamento sensato sem que ninguém tenha escrito todos os passos de antemão.

Aprender como se aprende a cozinhar

A analogia mais cómoda é a cozinha. Ninguém aprende a cozinhar só a ler. Experimenta-se, serve-se, alguém faz uma cara, e essa cara vale mais do que meia receita. Com o tempo a mão sabe quanto sal antes de a cabeça o raciocinar, e sabe-o porque foi acumulando pequenas correções.

Um sistema que aprende por reforço faz algo parecido, sem sabor e sem fome. O que recebe não é um sabor mas um número, e o que ajusta não é a mão mas uma preferência por certas ações. O mecanismo é diferente; o feitio da curva é muito semelhante.

Vale a pena ficar com as peças mínimas, que são poucas e contam-se depressa:

  • Um ambiente onde acontecem coisas e onde cada ação tem consequência.
  • Um conjunto de ações possíveis, que podem ser quatro ou podem ser muitíssimas.
  • Um sinal que indica se o resultado ficou melhor ou pior do que antes.
  • Muitas tentativas, porque uma única prova não ensina absolutamente nada.

Porque a paciência faz parte do método

Aqui está a parte que mais se parece com a vida corrente. Este tipo de aprendizagem é lento por desenho. Precisa de errar muitas vezes para distinguir a sorte do acerto, e precisa que alguém tenha escolhido bem o que é premiado, porque um prémio mal escolhido ensina exatamente aquilo que ninguém queria ensinar.

Há ainda um equilíbrio delicado entre repetir o que já funciona e experimentar algo novo. Ficar pelo conhecido dá resultados aceitáveis logo a seguir; explorar custa ao princípio e às vezes compensa depois. Quem já escolheu restaurante numa cidade desconhecida reconhece o dilema sem precisar de explicação.

Esse é talvez o pormenor que mais se perde ao contar. Não há atalho. A melhoria chega por acumulação, e a acumulação pede tempo e uma certa tolerância ao erro.

Até onde vai a metáfora

Não vai muito longe, e convém dizê-lo. O método não percebe nada do que faz, não tem intenções e não serve para tudo. É uma maneira concreta de afinar um comportamento à custa de repetição e de sinais, e no seu terreno isso já é bastante útil.

Contado assim, sem ruído, o assunto perde mistério e ganha interesse. Nicole Junkermann prefere esse registo para o que é técnico, o mesmo que defende em Escribir quando é preciso explicar algo difícil sem o achatar. A entrada anterior, sobre a inteligência artificial na Índia, olha para a mesma tecnologia de fora, e o resto do caderno segue nas notas em português.