DataOps真能“降本增效”?

news2024/12/27 17:53:13

在各行各业中,越来越多的公司开始重视收集数据,并寻找创新方法来获得真实可行的商业成果,并且愿意投入大量时间和金钱来实现这一目标。

file

据IDC称,数据和分析软件及云服务市场规模在 2021 年达到了 900 亿美元,随着企业继续对人工智能和机器学习 (AI/ML) 和现代数据计划进行投资,预计到 2026 年将增长一倍以上。

然而,尽管投入了大量资金,数据项目往往收效甚微。麦肯锡最近对高级主要分析项目进行的一项调查发现,公司 80% 的时间都花在准备数据等重复性任务上,而这些任务产生的增值作用有限。此外,他们还发现,只有 10% 的公司认为他们已经控制住了这个问题。

项目为何失败?

尽管增加了投资和关注,数据项目的失败率为什么仍然如此之高?

许多变量都会影响项目的成功,经常被提及的因素包括项目复杂性和对应的开发人才技术水平。企业也意识到,许多数据项目都失败了,是因为他们难以在生产中大规模实施数据计划。

这导致了 DataOps 的出现,成为克服大数据项目中常见挑战的新框架。DataOps 是敏捷工程和 DevOps 最佳实践在数据管理领域的应用,能帮助企业快速将新见解转化为完全可操作的生产交付成果,从而从数据中释放出商业价值。

数据调度的挑战

大多数数据工作流都非常复杂,需要跨多个不同的应用程序、数据源和基础架构技术运行,并且这些技术需要协同工作。虽然目标是在生产中实现这些流程的自动化,但现实情况是,如果没有强大的工作流调度平台,在企业规模上交付这些项目可能会非常昂贵,而且通常需要花费大量时间进行手动工作。

2023年1月份,白鲸开源正式发布了 Apache DolphinScheduler商业版Whalescheduler。相比于开源版本,商业版拥有更为专业的服务支持,感兴趣的小伙伴可以看下这篇文章进一步了解:什么是数据调度平台 WhaleScheduler

数据工作流调度项目有四个关键阶段:

  • 数据引入:这涉及从传统来源(如企业资源规划 (ERP) 和客户资源管理 (CRM) 解决方案、金融系统等)以及现代来源(如设备、物联网 (IoT) 传感器和社交媒体)收集数据。

  • 数据存储:存储数据的方式和地点取决于持久性、数据集的相对价值、分析模型的刷新率以及数据移动到处理阶段的速度。

  • 数据处理:处理阶段也面临许多挑战,包括需要多少处理能力?是恒定的还是可变的?是定期的、事件驱动的还是临时的?如何将成本降到最低?

  • 洞察传递:这需要将数据输出移动到分析系统。这一层同样复杂,有越来越多的工具代表数据管道中的最后一英里。

随着新数据和云技术的频繁推出,公司不断重新评估其技术堆栈。这种不断发展的创新带来了压力和客户流失,这可能是一个挑战,因为公司需要轻松采用新技术并将其扩展到生产中。

最终,如果新的数据分析服务没有大规模投入生产,公司就无法获得可操作的见解或实现价值。

实现规模生产

在生产中成功大规模运行业务关键型工作流程并非偶然。正确的工作流程调度平台可以帮助您简化数据管道并获得所需的可行见解。

考虑到这一点,以下是您在工作流调度平台中需要寻找的八个基本功能

  • 支持异构工作流:各公司正在迅速转向云,在可预见的未来,工作流将跨越高度复杂的混合环境。对于许多公司而言,这将包括支持跨数据中心和多个私有云和/或公共云的大型机和分布式系统。Apache DolphinScheduler 是一个强大的开源分布式工作流调度平台,能够处理多种应用程序和基础设施的多样性,提供一致的自动化策略。

  • SLA 管理:业务工作流(从预测风险的 ML 模型到财务结算和付款结算)都有完成 SLA,这些 SLA 有时受监管机构制定的准则的约束。您的调度平台必须能够理解并通知您复杂工作流中的任务失败和延迟,并且需要能够将问题映射到更广泛的业务影响。

  • 错误处理和通知:在生产中运行时,即使是设计得最好的工作流程也会出现故障和延迟,而海豚调度恰恰有非常完善的告警机制,并支持一些主流的平台

  • 自我修复和补救:响应业务工作流中的作业故障时,平台会采取纠正措施,例如重新启动作业、删除文件或刷新缓存或临时表。调度平台应允许自动化工程师配置此类操作,以便在下次发生相同问题时自动执行。

  • 端到端可视性:工作流跨混合技术栈执行互连的业务流程。调度平台应该能够清晰地显示工作流的沿袭。这对于帮助工程师了解应用程序与其支持的业务流程之间的关系至关重要。这对于变更管理也很重要。在进行变更时,了解流程上游和下游发生的情况至关重要。

  • 自助式用户体验:工作流调度是一项团队活动,涉及许多利益相关者,例如数据团队、开发人员、运营、业务流程所有者等。每个团队对于如何与调度工具交互都有不同的用例和偏好。

  • 生产标准:在生产中运行工作流需要遵守标准,这意味着使用正确的命名约定、错误处理模式等。您的调度平台应该有一个机制,提供一种非常简单的方法来定义这些标准,并在用户构建工作流时引导遵循适当的标准。

  • 支持 DevOps 实践:随着公司采用 DevOps 实践,例如持续集成和持续部署 (CI/CD) 管道、工作流开发、修改甚至工作流基础设施部署,您的调度平台应该能够适应现代发布实践。

对数据的需求正在上升,并且没有减弱的迹象,这意味着拥有存储、处理和操作数据的能力对于任何企业的成功仍然至关重要。DataOps 实践与强大的调度功能相结合,可以帮助企业调度数据管道、简化数据交付流程并改善业务成果。

WhaleStudio是白鲸开源根据全球领先的DataOps理念打造的新一代全栈数据集成调度产品,具有分布式、云原生并带有强大可视化界面的特点,将全球领先的调度开发组件Apache DolphinScheduler与数据集成组件Apache SeaTunnel集成在一起提供给全球用户领先的完整解决方案,支持170+数据源集成并全面支持信创环境,目前已服务于6000+企业。

本文来源于:https://www.datanami.com/2024/05/15/unlock-your-data-initiatives-with-dataops/ 如有侵权,请联系删除

本文由 白鲸开源科技 提供发布支持!

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.coloradmin.cn/o/1842968.html

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈,一经查实,立即删除!

相关文章

T230L单路HDMI高清采集卡带1路HDMI环出

同三维T230L单路HDMI高清采集卡 带1路HDMI环出 产品简介: 同三维T230L是在老款T230L基础上升级的产品,由输入环出4K30升级到4K60,此款产品是一款单路(1路)HDMI高清音视频采集卡,还带1路HDMI环出,可采集1路…

自由度与反证法

在 一道全等三角形几何证明题 的最后我使用反证法获得了解法三,但只是稍微提到了自由度,本文详细说一下,然后下一篇文章给出我的一个求最小生成树的新方法,同样基于自由度和反证法。 再次给出那道几何题,并给出一些话…

手机携号转网接口查询与对接指南:技术开发者必备手册

在当今通信技术飞速发展的背景下,手机携号转网已成为推动电信市场竞争、保障用户权益的重要手段。而对于技术开发者而言,掌握手机携号转网接口的查询与对接方法,无疑是提升服务兼容性和用户满意度的关键。 比如如下应用场景: 1.…

如何删除电脑自带的游戏

要删除电脑自带的游戏,如扫雷和纸牌,你可以按照以下步骤操作,这些步骤基于Windows操作系统: 对于Windows 7及其更早版本 打开控制面板选择“程序”打开或关闭Windows功能找到并取消勾选游戏 对于Windows 10及更高版本 打开“设…

基于Springboot+vue 共享车位系统小程序-计算机毕设 附源码94559

Springboot 共享车位系统小程序 摘 要 在信息飞速发展的今天,网络已成为人们重要的信息交流平台。每天都有大量的农产品需要通过网络发布,为此,本人开发了一个基于springboot共享车位系统小程序。 对于本共享车位系统的设计来说,…

Ike-scan一键发现通过互联网的IPsec VPN服务器(KALI工具系列二十八)

目录 1、KALI LINUX 简介 2、Ike-scan工具简介 3、信息收集 3.1 目标主机IP(服务器) 3.2 KALI的IP 4、操作示例 4.1 简单扫描 4.2 范围扫描 4.3 扫描多个目标 4.4 输出扫描结果 4.5 特殊扫描 5、总结 1、KALI LINUX 简介 Kali Linux 是一个功…

【R语言】对一个Plot绘制多个图,并且每个图单元也包含多个图

以一个Plot绘制五行六列共30个图&#xff0c;然后每30个图单元包含两个图为例&#xff1a; 如下图所示&#xff1a; 代码如下&#xff1a; for (i in 1:(5*6)) {create_subplots <- function() {library(ggplot2)library(dplyr)library(tidyr)# 创建一个随机的数据框simula…

传统后端SQL数据层替代解决方案: 内置数据源+JdbcTemplate+H2数据库 详解

内置数据源 我们回顾一下druid数据源的配置方式 通过type属性指定数据源的类型 导入依赖 starter就使用了spring的自动装配功能 格式二是在引入druid的依赖的基础上 进行的一种配置方式 Tomcat内部也可以进行数据源的配置 轻量级中最快的数据源对象 我们切换德鲁伊连接池 我…

springboot vue 开源 会员收银系统 (7) 收银台的完善 新增开卡 结算

前言 完整版演示 开发版演示 在前面的开发中&#xff0c;我们成功完成了商品分类和商品信息的搭建&#xff0c;开发了收银台基础。现在&#xff0c;我们将进一步完善收银台的功能&#xff0c;添加开卡和结算功能&#xff0c;并在后台实现会员卡的创建和订单保存。同时&#xff…

船舶行业信息安全解决方案介绍

船舶行业信息安全背景&#xff1a; 近年来随着经济复苏、疫情与国际形势影响国内外船舶海运业务蓬勃发展&#xff0c;在业务量激增的背景下出现多类信息安全事件。其中2017年&#xff0c;马士基集团遭到勒索软件攻击&#xff0c;内部业务系统和码头操作系统均受到严重影响&…

U盘数据恢复,小白也适用的4个方法!

你是否曾经遇到过这样的情况&#xff1a;当你满怀期待地插入U盘&#xff0c;准备欣赏那些珍贵的照片、视频或重要文件时&#xff0c;却发现U盘中的数据仿佛被一阵海风轻轻吹散&#xff0c;只剩下空荡荡的文件夹和一片茫然。那种失落感&#xff0c;就像是突然发现手中的藏宝图被…

(四十三)Vue Router之嵌套路由

文章目录 什么是嵌套路由嵌套路由的使用demo 上一篇&#xff1a;&#xff08;四十二&#xff09;Vue之路由及其基本使用Vue Router 什么是嵌套路由 实际生活中的应用界面&#xff0c;有可能由多层嵌套的组件组合而成。同样地&#xff0c;URL 中各段动态路径也按某种结构对应嵌…

数据可视化案例

数据可视化案例 相关的技术&#xff1a;scrapy、pandas、pyecharts。 使用豆瓣电影中的数据来进行可视化&#xff0c;网址&#xff1a;豆瓣电影 Top 250 (douban.com) 一、网页数据分析 我们需要爬取的是豆瓣电影Top250网页每一页的电影名称、图片链接、导演、年份、国家、电…

Bert模型实现中文新闻文本分类

Bert基于Transformer架构是解决自然语言处理的深度学习模型&#xff0c;常使用在文本分类、情感分析、词性标注等场合。 本文将使用Bert模型对中文文本进行分类&#xff0c;其中训练集数据18W条&#xff0c;验证集数据1W条,包含10个类别的文本数据&#xff0c;数据可以自己从Ka…

大润发超市购物卡怎么用?

收到大润发超市的礼品卡以后&#xff0c;我才发现&#xff0c;最近的大润发也得十来公里 为了100块的大润发打车也太不划算了 叫外送也不在配送范围内 最后没办法&#xff0c;在收卡云上出掉了&#xff0c;还好最近价格不错&#xff0c;也不亏&#xff0c;收卡云的到账速度也…

leetcode:557. 反转字符串中的单词 III(python3解法)

难度&#xff1a;简单 给定一个字符串 s &#xff0c;你需要反转字符串中每个单词的字符顺序&#xff0c;同时仍保留空格和单词的初始顺序。 示例 1&#xff1a; 输入&#xff1a;s "Lets take LeetCode contest" 输出&#xff1a;"steL ekat edoCteeL tsetnoc…

使用飞书多维表格实现推送邮件

一、为什么用飞书&#xff1f; 在当今竞争激烈的商业环境中&#xff0c;选择一款高效、智能的办公工具至关重要。了解飞书的朋友应该都知道&#xff0c;飞书的集成能力是很强大的&#xff0c;能够与各种主流的办公软件无缝衔接&#xff0c;实现数据交互&#xff0c;提升工作效…

恒创科技:云主机上的数据安全如何保证?(实用性技巧分享)

云主机上的数据安全如何保证?答案很简单&#xff0c;虽很多用户却不能完全做到&#xff0c;但我们可以了解一些安全措施予以防范。以下是云主机数据保护的几个实用技巧&#xff0c;希望对您有所帮助! 1.避免将敏感信息存储在云中 网络上的许多建议听起来都像这样&#xff1a;“…

业余时间做跨境电商实现经济自由,我是怎么做的?

在知乎问答上翻阅大家非常感兴趣的问题&#xff0c;解答一些疑惑的同时&#xff0c;发现大家对跨境电商还是很感兴趣的&#xff0c;类似“小白如何入局跨境电商&#xff1f;2024跨境电商平台&#xff0c;哪些值得做&#xff1f;现在电商哪个平台好做?”等的这些主观问题&#…

ubuntu访问windows共享文件夹

方法: Ubuntu访问Windows共享文件夹的方法-CSDN博客 基于交换机的PC端网络通信_服务器交换机pc端-CSDN博客 补充说明&#xff1a; 在这里面输入&#xff1a; smb://192.168.0.30/WindowsShareToLinux