Forum Discussion

Syndicate_Admin's avatar
Syndicate_Admin
Icon for Administrator rankAdministrator
3 years ago

Agrupación de palabras de Python

Hola

Actualmente me enfrento a un problema de agrupación en clústeres de Python. Me gustaría extraer de una columna (digamos "comentario") de la tabla "datos sin procesar" los comentarios individuales de los clientes, eliminar palabras vacías y luego agrupar por términos que suenan similares. Suena similar porque diéresis como ä, ö ... no siempre se guardan / muestran correctamente.

Desafortunadamente, no puedo conseguir que un visual funcione aquí. ¿Alguien puede ayudarme aquí?

Código que intenté usar:

# El siguiente código para crear un marco de datos y eliminar filas duplicadas siempre se ejecuta y sirve como preámbulo para el script:

# dataset = pandas. DataFrame(Comentarios)
# dataset = dataset.drop_duplicates()
# Pegue o ingrese su código de script aquí:
importación Pandas como Pd
importación NLTK
De NLTK.corpus importación Palabras vacías
De NLTK.tokenizar importación word_tokenize

Df = Pd.read_excel("C:\Usuarios\Datos.xlsx")
Def extract_entities(Mensaje de texto😞
stop_words = poner(Palabras vacías.palabras('Alemán'))
word_tokens = word_tokenize(Mensaje de texto)
filtered_tokens = [palabra.bajar() para palabra en word_tokens si palabra.bajar() no en stop_words y palabra.ISALPHA()]
Etiquetado = NLTK.pos_tag(filtered_tokens, largo='de')
Entidades = NLTK.pedazo.ne_chunk(Etiquetado, binario=Verdadero)
devolución Entidades
Df['entidades'] = Df[«Disp_Comments»].aplicar(extract_entities)
Df.Groupby('entidades')[«Disp_Comments»].contar()
Los datos a veces se ven así:
IDENTIFICACIÓNComentario
1Cancelar cancelación
2Factura

1 Reply

  • Su objeto visual de Python necesita trazar algo en el renderizador predeterminado. ¿Qué planeas mostrar una vez que hayas terminado?