Introdução ao Processamento de Linguagem Natural (PLN)
Introdução
Introdução
Alguém já usou assistentes virtuais como Siri, Alexa ou Google Assistente?
Introdução
Como vocês acham que eles entendem o que você diz?
Introdução
PLN - Processamento de Linguagem Natural
Introdução
PLN - Processamento de Linguagem Natural
Distâncias
Precisamos de uma revisão do Teste de Turing!
HORA
DA REVISÃO!
Teste de Turing
O Teste de Turing foi proposto por Alan Turing em 1950 na publicação “Computing Machinery and Intelligence”.
O objetivo é determinar se um programa de computador é ou não inteligente.
Teste de Turing
O programa é inteligente se a pessoa que participa do teste não conseguir dizer se foi o programa ou um ser humano que respondeu às suas perguntas.
Introdução
PLN - Processamento de Linguagem Natural
Introdução
Introdução
PLN - Processamento de Linguagem Natural
Introdução
PLN - Processamento de Linguagem Natural
Limpeza e Preparação de Dados com foco em PLN
Tokenização
Tokenização é o processo de divisão de um texto em tokens, que são pequenas partes de um texto, de forma a permitir representar um texto de uma maneira que seja mais significativa para as máquinas.
Ao realizar essa conversão, os algoritmos podem encontrar padrões com mais facilidade.
Tokenização
Tokenização de caracteres: é a segmentação do texto em caracteres individuais.
Por exemplo, dado a frase “Meu nome”, temos 8 tokens,
[“M”, “e”, “u”, “ ”, “n”, “o”, “m”, e”].
Tokenização
Tokenização de palavras: realizamos a divisão do texto em palavras individuais.
Por exemplo, dado a frase “Meu nome não é Maria”, temos 5 tokens,
[“Meu”, “nome”, “não”, “é”, “Maria”].
Meu nome não é Maria.
Tokenização
Tokenização de subpalavras: é um equilíbrio entre os dois métodos anteriores, onde dividimos um texto em unidades que podem ser iguais ou maiores que um caractere, mas iguais ou menores a uma palavra inteira.
Por exemplo, na frase “Fulano fugiu sutilmente”, podemos dividir em 4 tokens,
[“Fulano”, “fugiu”, “sutil”, “mente”].
Stopwords
Stopword é um conjunto de palavras usadas comumente em um idioma, que no PLN é usada para eliminar palavras que são de uso comum em textos, porém que trazem pouca informação útil.
A remoção dos stopwords direciona nossa atenção para as palavras mais relevantes do texto!
Revisão
Precisamos de uma revisão de gramática!
HORA
DA REVISÃO!
Remoção de Stopwords
21
Conceito | Exemplos |
Artigos | o, a, os, as, um, uma |
Preposições | de, em, por, para, com, sem, sobre, até, entre |
Conjunções | e, mas, ou, que, se |
Pronomes | eu, ele, me, te, se, nos |
Verbos auxiliares | ser, estar, ter, haver, ir |
Remoção de Stopwords
22
Stopwords
Cabe destacar que, embora as stopwords sejam usadas para remover palavras de baixa informação, as stopwords também podem ser usadas poderosamente na adição de contexto em um texto.�
Por exemplo, na frase: “O que é uma escola?”, a pergunta é do tipo “O que é” e não do tipo “Como é”. Com isso em mente, poderíamos obter uma busca com resultados mais refinados.
Lematização e Stemming
Lematização e stemming são técnicas de processamento de texto que aproximam as palavras à sua forma raiz.
HORA
DA REVISÃO!
Lematização
25
Lematização
26
Stemming
27
Lematização e Stemming
28
Word Cloud (Nuvem de palavras)
Word cloud (Nuvem de palavras) é uma representação visual de dados de texto. Cada palavra é representada com diferentes tamanhos a partir do quanto esta palavra é usada no texto, ou seja, quanto maior o tamanho da palavra na nuvem, mais frequente ela é utilizada no texto.
Word Cloud (Nuvem de palavras)
Mineração de texto (Text Mining)
A mineração de texto, conhecida também como mineração de dados textuais, é o processo de transformação de texto não estruturado em texto estruturado para possibilitar a identificação de padrões significativos.
Mineração de texto (Text Mining)
Dados estruturados: são dados com um formato padronizado para acesso eficiente por software e humanos. Os dados estruturados incluem entradas como nomes, endereços e números de telefone.
Mineração de texto (Text Mining)
Dados não estruturados: estes dados não apresentam um formato de dados predefinido. Podem incluir texto de diferentes fontes, como redes sociais ou avaliações de produtos, ou arquivos de imagem, vídeo e áudio.
Mineração de texto (Text Mining)
Dados semi estruturados: como o nome sugere, esses dados são uma combinação entre os formatos de dados estruturados e não estruturados.�
Eles não se encaixam em uma tabela rígida (como uma planilha), mas ainda possuem alguma forma de organização.
Fixando o conteúdo…
Atividade
Agora que concluímos as aulas sobre Introdução ao Processamento de Linguagem Natural (PLN), é hora de aplicar os conhecimentos adquiridos na prática.
Divisão em grupos: Dividir a turma em pequenos grupos de 3 a 4 alunos.
Atividade
Leitura e Discussão: Será entregue um exemplar de um texto, leiam o texto cuidadosamente e discutam suas principais ideias e informações.
Análise: Identifiquem e destaquem as informações mais importantes e relevantes no texto.
Aplicação de Técnicas de PLN: Apliquem as técnicas de Processamento de Linguagem Natural que vocês aprenderam, como tokenização, remoção de stopwords, e stemming/lematização, para produzir um esboço de nuvens de palavras.
Atividade
Texto: O Impacto da Inteligência Artificial na Indústria
Nos últimos anos, a Inteligência Artificial (IA) se tornou central em muitas indústrias, transformando operações e interações com clientes. A IA analisa grandes volumes de dados rapidamente, permitindo decisões mais informadas e eficientes.
A automação de processos e os chatbots melhoraram a eficiência e a experiência do cliente, realizando tarefas rapidamente e oferecendo suporte constante. No entanto, a adoção da IA levanta preocupações éticas, como a substituição de empregos humanos. É crucial considerar o impacto social e investir em requalificação da força de trabalho.
A IA deve ser desenvolvida de forma transparente e justa, evitando preconceitos e garantindo que as decisões automatizadas sejam explicáveis. Governança e regulamentação são essenciais para assegurar que a IA beneficie a sociedade. Em resumo, a IA tem grande potencial, mas deve ser usada de maneira responsável e ética.
Atividade
Agora, o grupo deve apresentar a solução encontrada, detalhando o processo e as técnicas empregadas:
Fechamento
PLN: Área da computação que possibilita que computadores entendam, interpretem e gerem linguagem humana.
Em PLN, a qualidade da entrada define a qualidade da saída: pré-processar permite transformar dados em informação útil!
A preparação de dados reduz ruídos, gera uniformidade, melhora a performance e facilita a análise.
Técnicas incluem tokenização, stopwords, stemming, lematização, word cloud e mineração de texto.
Referências
Referências
https://brasileiraspln.com/livro-pln/1a-edicao/
FOOTE, K. D. A Brief History of Natural Language Processing. DATAVERSITY, 6 jul. 2023. Disponível em: <https://www.dataversity.net/a-brief-history-of-natural-language-processing-nlp/>. Acesso em: 29 jul. 2024
PLN: o que é Processamento de Linguagem Natural? | Alura. Disponível em: <https://www.alura.com.br/artigos/o-que-e-pln>. Acesso em: 28 jul. 2024.
ROBSJC, R. O. Use o Alexa – Desenvolva assistentes virtuais – ABRACD – ASSOCIAÇÃO BRASILEIRA DE CIÊNCIA DE DADOS. , 25 jan. 2021. Disponível em: <https://abracd.org/2021/01/25/use-o-alexa-desenvolva-assistentes-virtuais/>. Acesso em: 29 jul. 2024
Produção do Material
43
Apoio
Apoio
45