Jornacitec Botucatu, XIV JORNACITEC - Jornada Científica e Tecnológica

Tamanho da fonte: 
AVALIAÇÃO DOS IDIOMAS INGLÊS E PORTUGUÊS NO DESEMPENHO DE UM CHATBOT ACADÊMICO PARA ENGENHARIA DE BIOPROCESSOS
Gabriel Godoi Souza Costa, Pedro Augusto Brockes Zakaib, Victor Crespo de Oliveira, Sergio Augusto Rodrigues

Última alteração: 2025-10-09

Resumo


A inteligência artificial (IA) tem se destacado como uma ferramenta estratégica na modernização dos bioprocessos, especialmente no contexto da fermentação, onde a análise e extração de informações técnicas em textos científicos pode ser otimizada por meio de modelos de linguagem natural (SINGHAL et al., 2021) O uso de Modelos de Linguagem de Grande Escala (LLMs), como o Mini-GPT-4.0, tem demonstrado grande potencial em tarefas de interpretação de dados, síntese textual e geração de respostas contextualizadas (MOUJAHID et al., 2024). Esses modelos, ao serem integrados em interfaces computacionais acessíveis, contribuem significativamente para a organização e disseminação do conhecimento técnico-científico, como defendido por Lalwani et al. (2018), além de promoverem o aprendizado autônomo em ambientes educacionais (HENG et al., 2023). O objetivo deste estudo é o desenvolvimento de um chatbot acadêmico bilíngue, capaz de responder perguntas técnicas em português e inglês sobre fermentação, área bastante importante para o Engenheiro de Biorpocessos, a partir da análise de artigos científicos. A metodologia envolveu a criação de um ambiente integrado entre R e Python, utilizando o pacote reticulate para comunicação entre as linguagens. O RStudio foi a plataforma principal, com construção de interface gráfica por meio do pacote shiny, permitindo que o usuário envie arquivos em PDF de artigos científicos e faça perguntas sobre os mesmos. A base relacional foi estruturada no banco de dados SQLite, utilizando o pacote RSQLite, onde são armazenados os arquivos, perguntas e respostas geradas, com registro temporal e integridade referencial. No backend, o chatbot foi desenvolvido em Python, utilizando bibliotecas como langchain, pinecone-client, pypdf e langchain-openai, além da configuração das APIs da OpenAI e Pinecone por meio do pacote dotenv, assegurando segurança no manuseio das variáveis de ambiente. A arquitetura foi estruturada com a cadeia de execução RetrievalQA, que permite transformar o conteúdo textual em vetores semânticos e realizar a busca por similaridade no banco vetorial do Pinecone, recuperando passagens relevantes com base na pergunta do usuário. O sistema foi testado quanto à sua funcionalidade, comunicação entre os ambientes R e Python e qualidade das respostas fornecidas, demonstrando resultados preliminares satisfatórios. A próxima etapa do projeto será dedicada à comparação sistemática entre os idiomas português e inglês, com a aplicação de métricas descritas por Vannala et al. (2022), a fim de verificar possíveis variações na consistência e precisão das respostas. Conclui-se, portanto, que essa ferramenta se mostra promissora para a área da Engenharia. O uso da inteligência artificial aplicada à leitura e interpretação de textos científicos em biotecnologia pode oferecer contribuições significativas para estudantes e docentes.


Texto completo: PDF