-
Notifications
You must be signed in to change notification settings - Fork 23
Expand file tree
/
Copy patheval.sh
More file actions
60 lines (53 loc) · 1.82 KB
/
Copy patheval.sh
File metadata and controls
60 lines (53 loc) · 1.82 KB
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
#!/bin/bash
export HF_ENDPOINT=https://hf-mirror.com
# MMMU-Medical-test,MMMU-Medical-val,PMC_VQA,MedQA_USMLE,MedMCQA,PubMedQA,OmniMedVQA,Medbullets_op4,Medbullets_op5,MedXpertQA-Text,MedXpertQA-MM,SuperGPQA,HealthBench,IU_XRAY,CheXpert_Plus,MIMIC_CXR,CMB,CMExam,CMMLU,MedQA_MCMLE,VQA_RAD,SLAKE,PATH_VQA,MedFrameQA,Radrestruct
EVAL_DATASETS="Medbullets_op4"
DATASETS_PATH="hf"
OUTPUT_PATH="eval_results/{}"
# TestModel,Qwen2-VL,Qwen2.5-VL,BiMediX2,LLava_Med,Huatuo,InternVL,Llama-3.2,LLava,Janus,HealthGPT,BiomedGPT,Vllm_Text,MedGemma,Med_Flamingo,MedDr
MODEL_NAME="Qwen2.5-VL"
MODEL_PATH="Qwen2.5-VL-7B-Instruct"
#vllm setting
CUDA_VISIBLE_DEVICES="0"
TENSOR_PARALLEL_SIZE="1"
USE_VLLM="False"
#Eval setting
SEED=42
REASONING="False"
TEST_TIMES=1
# Eval LLM setting
MAX_NEW_TOKENS=8192
MAX_IMAGE_NUM=6
TEMPERATURE=0
TOP_P=0.0001
REPETITION_PENALTY=1
# LLM judge setting
USE_LLM_JUDGE="True"
# gpt api model name
GPT_MODEL="gpt-4.1-2025-04-14"
JUDGE_MODEL_TYPE="openai" # openai or gemini or deepseek or claude
API_KEY=""
BASE_URL=""
# pass hyperparameters and run python sccript
python eval.py \
--eval_datasets "$EVAL_DATASETS" \
--datasets_path "$DATASETS_PATH" \
--output_path "$OUTPUT_PATH" \
--model_name "$MODEL_NAME" \
--model_path "$MODEL_PATH" \
--seed $SEED \
--cuda_visible_devices "$CUDA_VISIBLE_DEVICES" \
--tensor_parallel_size "$TENSOR_PARALLEL_SIZE" \
--use_vllm "$USE_VLLM" \
--max_new_tokens "$MAX_NEW_TOKENS" \
--max_image_num "$MAX_IMAGE_NUM" \
--temperature "$TEMPERATURE" \
--top_p "$TOP_P" \
--repetition_penalty "$REPETITION_PENALTY" \
--reasoning "$REASONING" \
--use_llm_judge "$USE_LLM_JUDGE" \
--judge_model_type "$JUDGE_MODEL_TYPE" \
--judge_model "$GPT_MODEL" \
--api_key "$API_KEY" \
--base_url "$BASE_URL" \
--test_times "$TEST_TIMES" \