Forum Discussion
DataflowsError
gracias por la respuesta, ya nos hemos dividido en 10 flujos de datos, pero en qlik el tamaño total de qvd es de alrededor de 70-80 GB, la fuente sin procesar son archivos csv, también otra pregunta sobre alcanzar el límite de 24 horas, si elimino ese campo de texto en uno de los flujos anteriores, solía ejecutarse en 4-5 horas algunos días, algunos días de 7 a 8 horas, por qué la diferencia en el tiempo y, a veces, alcanzar el límite de 24 horas, hay una gran variación en el tiempo para los 10 flujos de datos que van desde 4 horas hasta llegar a 24 horas y el tiempo de espera de Qlik es bastante consistente y se completa entre 3 y 4 horas, también Qlik tiene solo 1 aplicación que lo hace y Power BI se ha dividido en 10 flujos de datos
En función de lo que ha compartido, la variabilidad en tiempo de ejecución incluso después de dividirse en 10 flujos de datos sugiere que el problema puede estar relacionado con la forma en que Power BI controla la asignación de recursos y el rendimiento de E/S durante la extracción.
Los flujos de datos, especialmente los que trabajan directamente con archivos planos de gran tamaño como los CSV, pueden experimentar un rendimiento incoherente debido a factores como la estructura del archivo de entrada, el comportamiento de compresión y la carga de back-end en el momento de la ejecución. Si los archivos varían en tamaño de fila, codificación o contenido de columna (como campos de texto de alta varianza), eso puede hacer que ciertas ejecuciones tarden mucho más tiempo, incluso si el tamaño total del archivo es similar.
Además, dado que no hay ninguna transformación, Power BI intenta ingerir todo el conjunto de datos tal cual y, con columnas con mucho texto, los tamaños de los paquetes pueden aumentar de forma impredecible en función de la distribución del contenido en un día determinado.
Las comparaciones con Qlik son válidas, y la diferencia de rendimiento se reduce en gran medida a las diferencias en la arquitectura de ingesta y en cómo cada plataforma maneja la memoria, el paralelismo y el procesamiento por lotes durante la carga.
Saludos
Hammad.
- Syndicate_Admin1 year agoAdministrator
Gracias por la respuesta, ¿cuál sería la mejor manera de programar los flujos de datos en secuencia, como 10 daatflows de extracción (que se ejecuta en paralelo) y luego el flujo de datos de transformación se ejecuta una vez que esos 10 flujos de datos se ejecutan correctamente y luego se ejecuta el informe
- Syndicate_Admin1 year agoAdministrator
Para el escenario 10 flujos de datos de extracción, seguido de un flujo de datos de transformación y, a continuación, una actualización de informe, el enfoque más sólido sería:
'* Use una canalización de Fabric Data Factory (si usa Microsoft Fabric). Puede agregar cada uno de los 10 flujos de datos de extracción como actividades de canalización independientes. A continuación, configúrelos para que se ejecuten en paralelo y, a continuación, agregue una dependencia "esperar a todos" antes de desencadenar el flujo de datos de transformación. Una vez completado el flujo de datos de transformación, agregue una actividad de actualización del modelo semántico de Power BI para actualizar el informe.
* Método alternativo a través de Power Automate (si no está usando Fabric), puede usar los desencadenadores/acciones "Actualizar un flujo de datos" y "Cuando se complete una actualización de flujo de datos". Este método funciona, pero puede resultar complejo para varias dependencias paralelas.
Esta configuración le dará un control total sobre la secuenciación, el manejo de errores y la supervisión en todas las etapas. Avíseme si desea ayuda para redactar una canalización de Fabric o configurarla en Power Automate.
Si no entiendo sus necesidades o aún tiene problemas con él, no dude en hacérnoslo saber.
Saludos
Hammad.
Equipo de apoyo a la comunidadSi esta publicación ayuda, márquela como una solución, para que otros miembros la encuentren más rápidamente.
Gracias.
- Syndicate_Admin1 year agoAdministrator
Gracias por la respuesta, ¿podemos programar 10 flujos de datos de extracción, 2 flujos de transformación Daat, 1 informe utilizando 1 flujo de Power Automate? ¿Podemos tener más de 1 desencadenador en el flujo de Power Automate?
- Syndicate_Admin1 year agoAdministrator
Gracias por seguir con la conversación. En Power Automate, cada flujo solo puede tener un desencadenador, por lo que no puede iniciar el flujo en función de varios eventos independientes (como varios flujos de datos que se completan).
Sin embargo, puede controlar toda la secuencia, desde la extracción de datos hasta su transformación y la actualización del informe dentro de un único flujo de Power Automate, siempre que lo inicie desde un punto de partida.
Saludos
Hammad.