操作系统及版本
ubuntu20.04
安装工具的python环境
docker容器中的python环境
python版本
3.10
AISBench工具版本
3.1.20260728
AISBench执行命令
ais_bench --models vllm_api_stream_chat --datasets longbenchv2_gen --num-warmups 0 --debug
模型配置文件或自定义配置文件内容
from ais_bench.benchmark.models import VLLMCustomAPIChat
from ais_bench.benchmark.utils.postprocess.model_postprocessors import extract_non_reasoning_content
import os
models = [
dict(
attr="service",
type=VLLMCustomAPIChat,
abbr="vllm-api-stream-chat",
path=os.environ.get('AIS_PATH', '/models/GLM-5'),
model=os.environ.get('AIS_MODEL', 'GLM-5'),
stream=True,
request_rate=float(os.environ.get('AIS_REQUEST_RATE', '1.0')),
use_timestamp=False,
traffic_cfg = dict(burstiness=0),
retry=2,
api_key="",
host_ip=os.environ.get('AIS_HOST_IP', '0.0.0.0'),
host_port=int(os.environ.get('AIS_HOST_PORT', '8000')),
url="",
max_out_len=int(os.environ.get('AIS_MAX_OUT_LEN', '1024')),
batch_size=int(os.environ.get('AIS_BATCH_SIZE', '32')),
# trust_remote_code=False,
generation_kwargs=dict(
temperature=float(os.environ.get('AIS_TEMP', '0.6')),
top_k = int(os.environ.get('AIS_TOP_K', '-1')),
top_p = float(os.environ.get('AIS_TOP_P', '1.0')),
seed = None,
ignore_eos=False,
),
pred_postprocessor=dict(type=extract_non_reasoning_content),
)
]
预期行为
模板和结果判定模式一致,精度对齐论文
实际行为
精度结果低于论文信息
前置检查
操作系统及版本
ubuntu20.04
安装工具的python环境
docker容器中的python环境
python版本
3.10
AISBench工具版本
3.1.20260728
AISBench执行命令
ais_bench --models vllm_api_stream_chat --datasets longbenchv2_gen --num-warmups 0 --debug
模型配置文件或自定义配置文件内容
from ais_bench.benchmark.models import VLLMCustomAPIChat
from ais_bench.benchmark.utils.postprocess.model_postprocessors import extract_non_reasoning_content
import os
models = [
dict(
attr="service",
type=VLLMCustomAPIChat,
abbr="vllm-api-stream-chat",
path=os.environ.get('AIS_PATH', '/models/GLM-5'),
model=os.environ.get('AIS_MODEL', 'GLM-5'),
stream=True,
request_rate=float(os.environ.get('AIS_REQUEST_RATE', '1.0')),
use_timestamp=False,
traffic_cfg = dict(burstiness=0),
retry=2,
api_key="",
host_ip=os.environ.get('AIS_HOST_IP', '0.0.0.0'),
host_port=int(os.environ.get('AIS_HOST_PORT', '8000')),
url="",
max_out_len=int(os.environ.get('AIS_MAX_OUT_LEN', '1024')),
batch_size=int(os.environ.get('AIS_BATCH_SIZE', '32')),
# trust_remote_code=False,
generation_kwargs=dict(
temperature=float(os.environ.get('AIS_TEMP', '0.6')),
top_k = int(os.environ.get('AIS_TOP_K', '-1')),
top_p = float(os.environ.get('AIS_TOP_P', '1.0')),
seed = None,
ignore_eos=False,
),
pred_postprocessor=dict(type=extract_non_reasoning_content),
)
]
预期行为
模板和结果判定模式一致,精度对齐论文
实际行为
精度结果低于论文信息
前置检查