【问题标题】:Insert/Update mass records SQL Server插入/更新大量记录 SQL Server
【发布时间】:2016-03-14 19:26:11
【问题描述】:

我有很多需要处理的记录的问题。我想知道哪种方法最快。

我的问题描述:

我有一张桌子(我们称之为FooTable),其中包含多个2.000.000.000 records 的ID(我们称之为FooId)。我需要总结我的FooId 以检查它重复了多少次。该表每秒都在增长,因为它就像一个日志表。

我尝试过的程序:

读取我的FooTable600 records 块,通过代码处理所有记录(对每个FooId 求和)执行GroupBy 并将结果存储在另一个表中(我们称之为FooResults )。这个FooResults 新表是在与旧表FooTable 相同的架构中创建的。

程序结果:

每个块的读取都非常快,数据处理也是如此。问题是储蓄。我的计算表明这将需要大约 27 天。这显然太过分了。

测试:

我用100.000 records 做了一个测试。处理此数据后得到6000 records,大约需要 32 秒;处理耗时 32 毫秒;节省了 18 分钟。

未来的尝试:

我正在考虑尝试在另一个模式中创建一个表,对所有记录执行唯一的读取操作,直到最后一个记录,处理内存中的所有数据并将其添加到这个新表中。这个新表将禁用索引。
在不使用实体框架的情况下尝试 sql。
尝试使用批处理。

使用的技术:

  • C#
  • 实体框架
  • Sql Server 2012

编辑 1:

此表中包含的数据是用于分析的关键数据,无法删除。

【问题讨论】:

  • 日志的一个好处是它们不是关键数据,可以在一段时间后删除,比如 30 天。
  • 问题在于这是用于分析的关键数据。它不能被删除。我将编辑我的问题。
  • 你可以使用 SqlBulkCopy msdn.microsoft.com/en-us/library/…
  • 除了GroupBy之外,您是在C#中进行其他特殊处理,还是需要DB外部的中间数据?我的意思是,我肯定会考虑将进程作为存储过程运行(你未来的“尝试不带 EF 的 sql”)。对于合理数量的数据和处理,EF 和其他 ORM 通常只是不执行。 SQL 是基于集合的,.NET 不是,数据库中基于集合的操作也是如此。
  • 另外,稍微分开一点 - 如果它每秒更新一次,也许看看一个模式绑定视图,它会计算 FooID,所以你有一个数据的“实时”视图。它可能会像狗一样表现或锁定我不知道的一切,但可能值得一看

标签: c# sql sql-server entity-framework bigdata


【解决方案1】:

您应该在数据库中将其作为查询运行。如果你想检查一个这样的值:

select count(*)
from table t
where fooid = @foodid;

table(fooid) 上创建一个索引,这将运行得非常快,即使是在 20 亿行上。

如果您需要查找所有 foo id 的计数:

select fooid, count(*)
from table t (with nolock)
group by fooid;

这需要更长的时间,但不是 27 天,而且它还可以利用索引。通常,您希望在数据库内部进行此类处理,而不是将数据带回应用程序。

您可能需要考虑是否要在用于插入的活动表上运行这些查询。 selectsinserts 可以减慢速度。您可能会考虑某种复制管理,以便您可以拥有数据库的另一个副本进行此类分析。最好不要在每秒更新多次的表上运行此类查询。

【讨论】:

  • 感谢您的回答。我想这样做,一个复制解决方案。我不知道那个 nolock 选项。我会测试一下。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2015-12-17
  • 2020-11-21
  • 1970-01-01
  • 1970-01-01
  • 2017-12-17
  • 2013-12-06
  • 1970-01-01
相关资源
最近更新 更多