Forum Discussion
DataflowsError
Hay algunos otros casos en los que el flujo de datos se mantiene en ejecución durante 24 horas y falla, ya que ese es el límite de tiempo de espera
Los flujos de datos de Power BI tienen limitaciones en cuanto a la cantidad de datos sin comprimir que se pueden contener en un solo paquete, especialmente cuando se trata de campos de texto libre grandes como el que ha mencionado. A diferencia de QlikSense, Power BI no fragmenta ni transmite campos de texto grandes de la misma manera durante la ingesta, lo que probablemente sea la razón por la que está llegando a un techo incluso con menos columnas.
Para responder a su pregunta, Power BI puede controlar grandes conjuntos de datos, pero existen restricciones arquitectónicas al cargarlos a través de flujos de datos, especialmente en escenarios de extracción en los que no hay lógica de transformación para dividir o agrupar los datos de forma natural. Esta es también la razón por la que se observan flujos de datos de larga duración que acaban alcanzando el tiempo de espera de 24 horas.
Es posible que desee explorar primero la preparación de los datos sin procesar fuera del flujo de datos (por ejemplo, almacenarlos en un lago de datos o un lago de datos y, a continuación, vincularlos) o dividir la carga en varios flujos de datos filtrados por alguna clave de lote, como la fecha o la región. De esa manera, evitas cargar demasiado a la vez y te mantienes dentro de los límites de la plataforma.
Saludos
Hammad.
- Syndicate_Admin1 year agoAdministrator
gracias por la respuesta, ya nos hemos dividido en 10 flujos de datos, pero en qlik el tamaño total de qvd es de alrededor de 70-80 GB, la fuente sin procesar son archivos csv, también otra pregunta sobre alcanzar el límite de 24 horas, si elimino ese campo de texto en uno de los flujos anteriores, solía ejecutarse en 4-5 horas algunos días, algunos días de 7 a 8 horas, por qué la diferencia en el tiempo y, a veces, alcanzar el límite de 24 horas, hay una gran variación en el tiempo para los 10 flujos de datos que van desde 4 horas hasta llegar a 24 horas y el tiempo de espera de Qlik es bastante consistente y se completa entre 3 y 4 horas, también Qlik tiene solo 1 aplicación que lo hace y Power BI se ha dividido en 10 flujos de datos
- Syndicate_Admin1 year agoAdministrator
En función de lo que ha compartido, la variabilidad en tiempo de ejecución incluso después de dividirse en 10 flujos de datos sugiere que el problema puede estar relacionado con la forma en que Power BI controla la asignación de recursos y el rendimiento de E/S durante la extracción.
Los flujos de datos, especialmente los que trabajan directamente con archivos planos de gran tamaño como los CSV, pueden experimentar un rendimiento incoherente debido a factores como la estructura del archivo de entrada, el comportamiento de compresión y la carga de back-end en el momento de la ejecución. Si los archivos varían en tamaño de fila, codificación o contenido de columna (como campos de texto de alta varianza), eso puede hacer que ciertas ejecuciones tarden mucho más tiempo, incluso si el tamaño total del archivo es similar.
Además, dado que no hay ninguna transformación, Power BI intenta ingerir todo el conjunto de datos tal cual y, con columnas con mucho texto, los tamaños de los paquetes pueden aumentar de forma impredecible en función de la distribución del contenido en un día determinado.
Las comparaciones con Qlik son válidas, y la diferencia de rendimiento se reduce en gran medida a las diferencias en la arquitectura de ingesta y en cómo cada plataforma maneja la memoria, el paralelismo y el procesamiento por lotes durante la carga.
Saludos
Hammad.
- Syndicate_Admin1 year agoAdministrator
Gracias por la respuesta, ¿cuál sería la mejor manera de programar los flujos de datos en secuencia, como 10 daatflows de extracción (que se ejecuta en paralelo) y luego el flujo de datos de transformación se ejecuta una vez que esos 10 flujos de datos se ejecutan correctamente y luego se ejecuta el informe