Skip to content

[需求] 希望能够支持现网流量会放的方式验证agent场景推理的处理能力 #498

Description

@chenghaitao1987

问题/痛点描述

当前工具不支持,下面的代码可以按照session发送,带functioncall的请求,普通会话和functioncall静态设置max token。
icl_multiturn_fc_inferencer.py
vllm_api_stream_chat_multiturn_fc.py
multiturn_fc_gen.py
multiturn_fc.py

上面的工具没有解决的问题
1、当前没有办法模拟用户数和并发数的比例,这个会kvcache有压力
2、真实对话场景的长尾问题不太好解决

建议方案

希望对此场景有规划方案,或者解决上述的痛点

备选方案

No response

预期价值

用户对agent场景性能评测有一个基准

参与意向

  • 我愿意参与此功能的开发或测试

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Type

Projects

No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions