【问题标题】:Neo4j-ogm: Decreasing write/mapping performanceNeo4j-ogm:降低写入/映射性能
【发布时间】:2016-11-08 20:48:05
【问题描述】:

在我的项目中,我使用 spring-data-neo4j 4.2.0.M1 和 neo4j-ogm 2.0.4。最初这是使用嵌入式 neo4j 实例,但在调查此问题的过程中,我已使用 Bolt 协议迁移到专用的 neo4j 实例(虽然在同一台机器上运行)。

我在不断地插入数据,基本上是因为它对我的应用程序可用(所以我不能使用批量插入)。启动后,这工作正常,保存我的 NodeEntity 的实例大约需要 60 毫秒,这对我的用例来说非常好。然而,随着时间的推移,这会慢慢退化。 10 到 20 分钟后,每次保存会减慢到 2 秒左右,这不再那么好了。时间似乎在这里达到顶峰,并且没有减少太多。

最初我认为这是由于嵌入式实例太小造成的,因为我看到 neo4j 报告有关 GC 暂停的重复消息。然后我迁移到一个更大的专用实例,并且这些 GC 警告不再出现。但是,降级仍然会发生。

neo4j 报告的存储大小:

Array Store 8.00 KiB
Logical Log 151.36 MiB
Node Store 40.14 MiB
Property Store 1.83 GiB
Relationship Store 742.63 MiB
String Store> Size 120.87 MiB
Total Store Size 4.55 GiB

实例配置如下:

dbms.memory.pagecache.size=5g
dbms.memory.heap.initial_size=4g
dbms.memory.heap.max_size=4g
dbms.jvm.additional=-XX:+UseG1GC

使用YourKit profiler(采样器模式!)我可以看到大部分时间似乎都花在neo4j-ogm的EntityGraphMapper上,特别是在

org.neo4j.ogm.context.EntityGraphMapper#haveRelationEndsChanged

正在保存的 NodeEntity 通常与其他节点有大约 40 个关系,其中大多数被建模为RelationshipEntity。在早期阶段,我已经注意到保存实体非常慢,因为也映射了太多相关(但未更改)的实体。从那时起,我在保存时使用深度 1。 导致节点实体被保存的连续操作使用 200 个实体的事务大小。

我还不相信,neo4j-ogm 实际上是放缓的原因,因为与良好的初始结果相比,我看不出有什么变化。 在这种情况下,我通常会怀疑内存泄漏/污染,但所有监控结果在我的应用程序中看起来都不错。对于 neo4j 服务器实例,除了 debug.log 之外,我真的不知道在哪里可以找到此类信息。

总而言之,我已经花了相当长的时间对此进行调查,但不知道还要看什么。有什么想法或建议吗?我很乐意提供更多信息。

编辑:根据@vince 的意见,我再次查看了内存分布,发现实际上 Neo4jSession 在让应用程序运行约 3 小时后增长了很多:

当时堆有 1.7 GB 大,其中 70% 引用了实时数据。其中,Neo4jSession 当前引用了大约 300mb(并保持活动状态)。这可能表明它已经变得太大了。 我怎么能在这里手动干预?

【问题讨论】:

  • 您是为每个事务(200 个实体的批次)创建一个新会话,还是使用单个会话?
  • 我正在使用相同的会话(我认为)。我没有任何手动处理会话,也使用默认范围。根据我从文档中了解到的情况,这对于长时间运行的操作应该有利于性能吗?在此期间,我不希望在我的工作线程之外有任何更新。
  • 实体在会话中停留,直到它们被垃圾收集。如果您要加载数千个实体,haveRelationEndsChanged 可能会对性能产生一些影响,因此可能值得在每个事务之间执行session.clear() 看看这是否有帮助。
  • @Vince:很好的建议,这似乎成功了!之前运行 3 小时的相同测试现在只需要 40 分钟,并且所有数据库插入的时间都是恒定的。由于现在这比请求进来的速度快,所以问题就解决了。我会尝试增加交易规模,因为我猜 200 太小了。请添加您的建议作为答案,我会接受。

标签: neo4j database-performance spring-data-neo4j-4 neo4j-ogm yourkit


【解决方案1】:

实体在会话中一直存在,直到它们被垃圾收集。如果您要加载数千个实体,haveRelationEndsChanged 可能会对性能产生一些影响,因此可能值得在每个事务之间执行session.clear() 看看这是否有帮助

【讨论】:

    【解决方案2】:

    希望现在帮助解决这个问题还为时不晚。

    我最近在 Set 中保存具有约 900 个关系的节点时遇到了同样的情况,并且可以使其执行时间从约 5 秒到 500 毫秒。我最初使用的是 neo4j-ogm 2.1.3,刚刚迁移到 3.0.0。尽管 3.0.0 更快,但两个版本的性能提升相似。

    这是一些伪代码(我现在无法分享真实代码):

    @NodeEntity(label = "MyNode")
    public class MyNode {
        @GraphId
        private Long id;
    
        @Index(unique = true, primary = true)
        private String myUniqueValue;
    
        private String value;
    
        @Relationship(type = "CONNECTS_TO")
        private Set<MyRelationship> relationships;
        // constructors, getters, setters
    }
    
    @Relationship(type = "CONNECTS_TO")
    public class MyRelationship {
    
        @GraphId
        private Long id;
    
        @StartNode
        private MyNode parent;
    
        @EndNode
        private MyNode child;
        // constructors, getters, setters
    }
    

    请注意,MyNode 有一个索引/唯一字段,我可以完全控制该值。 neo4j-ogm 将使用它来确定它是否应该执行CREATEMERGE 语句。在我的用例中,如果节点已经存在,我希望合并发生。

    另一方面,关系创建依赖于节点 ID(@GraphId 字段)。这是生成它的语句的一个小 sn-p:

    UNWIND {rows} as row MATCH (startNode) WHERE ID(startNode) = row.startNodeId MATCH (endNode) WHERE ID(endNode) = row.endNodeId...

    在慢速模式下,neo4j-ogm 将负责验证关系或其中的节点是否已保存,并将检索创建节点所需的 id。这是您在 YourKit 中捕获的操作。

    一个执行缓慢的例子:

    void slowMode() {
        MyNode parent = new MyNode("indexed-and-unique", "some value");
        for (int j = 0; j < 900; j++) {
            MyNode child = new MyNode("indexed-and-unique" + j, "child value" + j);
            parent.addRelationship(new MyRelationship(parent, child));
        }
        session.save(parent); // save everything. slow.
    }
    

    我找到的解决方案是将这些操作分成三个部分:

    • 只保存父节点

    • 保存子节点

    • 保存关系

    这要快得多:

    void fastMode() {
        MyNode parent = new MyNode("indexed-and-unique", "some value");
        for (int j = 0; j < 900; j++) {
            MyNode child = new MyNode("indexed-and-unique" + j, "child value" + j);
            parent.addRelationship(new MyRelationship(parent, child));
        }
        session.save(parent, 0); // save only the parent
        session.save(getAllChildsFrom(parent), 0); // save all the 900 childs
        // at this point, all instances of MyNode will contain an "id". time to save the relationships!
        session.save(parent);
    }
    

    需要注意的一点:neo4j-ogm 2.1.3 在保存节点集合 (session.save(getAllChildsFrom(parent), 0)) 时没有执行单个批处理语句,这仍然很啰嗦和缓慢,但没有以前那么慢。 3.0.0 版修复了这个问题。

    希望对你有帮助!

    【讨论】:

      【解决方案3】:

      前段时间我们遇到了几乎相同的情况,当时我们需要将大量数据存储到 neo4j。我们分析了如何处理这个问题的不同方法。所以我们找到了一些解决方案,如何加快向 neo4j 插入数据的速度。

      1. 使用原生 neo4j java 驱动程序而不是 spring-data。首先它是异步 api,如果此时 select 的数据可用性不重要,它会有所帮助。

      2. 使用事务插入多条记录(例如,每个事务插入 1000 次)。它将加快插入速度,因为在任何事务提交之后 neo4j 尝试使用 lucene 重新计算索引并且这需要时间。在您的情况下(使用 spring-data),任何插入都在单独的事务中执行。

      【讨论】:

      • 我真的很想避免为这种多样化的导入任务编写手动查询。 Spring-data-neo4j/neo4j-ogm 允许简化这一点。我会记住这个建议,但对于要处理的更新更相似的类似情况。
      猜你喜欢
      • 2014-10-27
      • 2019-07-31
      • 2020-07-08
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多