问题/痛点描述
当前工具不支持,下面的代码可以按照session发送,带functioncall的请求,普通会话和functioncall静态设置max token。
icl_multiturn_fc_inferencer.py
vllm_api_stream_chat_multiturn_fc.py
multiturn_fc_gen.py
multiturn_fc.py
上面的工具没有解决的问题
1、当前没有办法模拟用户数和并发数的比例,这个会kvcache有压力
2、真实对话场景的长尾问题不太好解决
建议方案
希望对此场景有规划方案,或者解决上述的痛点
备选方案
No response
预期价值
用户对agent场景性能评测有一个基准
参与意向
问题/痛点描述
当前工具不支持,下面的代码可以按照session发送,带functioncall的请求,普通会话和functioncall静态设置max token。
icl_multiturn_fc_inferencer.py
vllm_api_stream_chat_multiturn_fc.py
multiturn_fc_gen.py
multiturn_fc.py
上面的工具没有解决的问题
1、当前没有办法模拟用户数和并发数的比例,这个会kvcache有压力
2、真实对话场景的长尾问题不太好解决
建议方案
希望对此场景有规划方案,或者解决上述的痛点
备选方案
No response
预期价值
用户对agent场景性能评测有一个基准
参与意向