【发布时间】:2016-03-14 19:26:11
【问题描述】:
我有很多需要处理的记录的问题。我想知道哪种方法最快。
我的问题描述:
我有一张桌子(我们称之为FooTable),其中包含多个2.000.000.000 records 的ID(我们称之为FooId)。我需要总结我的FooId 以检查它重复了多少次。该表每秒都在增长,因为它就像一个日志表。
我尝试过的程序:
读取我的FooTable 的600 records 块,通过代码处理所有记录(对每个FooId 求和)执行GroupBy 并将结果存储在另一个表中(我们称之为FooResults )。这个FooResults 新表是在与旧表FooTable 相同的架构中创建的。
程序结果:
每个块的读取都非常快,数据处理也是如此。问题是储蓄。我的计算表明这将需要大约 27 天。这显然太过分了。
测试:
我用100.000 records 做了一个测试。处理此数据后得到6000 records,大约需要 32 秒;处理耗时 32 毫秒;节省了 18 分钟。
未来的尝试:
我正在考虑尝试在另一个模式中创建一个表,对所有记录执行唯一的读取操作,直到最后一个记录,处理内存中的所有数据并将其添加到这个新表中。这个新表将禁用索引。
在不使用实体框架的情况下尝试 sql。
尝试使用批处理。
使用的技术:
- C#
- 实体框架
- Sql Server 2012
编辑 1:
此表中包含的数据是用于分析的关键数据,无法删除。
【问题讨论】:
-
日志的一个好处是它们不是关键数据,可以在一段时间后删除,比如 30 天。
-
问题在于这是用于分析的关键数据。它不能被删除。我将编辑我的问题。
-
你可以使用 SqlBulkCopy msdn.microsoft.com/en-us/library/…
-
除了
GroupBy之外,您是在C#中进行其他特殊处理,还是需要DB外部的中间数据?我的意思是,我肯定会考虑将进程作为存储过程运行(你未来的“尝试不带 EF 的 sql”)。对于合理数量的数据和处理,EF 和其他 ORM 通常只是不执行。 SQL 是基于集合的,.NET 不是,数据库中基于集合的操作也是如此。 -
另外,稍微分开一点 - 如果它每秒更新一次,也许看看一个模式绑定视图,它会计算 FooID,所以你有一个数据的“实时”视图。它可能会像狗一样表现或锁定我不知道的一切,但可能值得一看
标签: c# sql sql-server entity-framework bigdata