Skip to content

Commit 64a26bd

Browse files
committed
Fix mypy errors in Ray/Modin modules
- Remove unused type: ignore comment in _utils.py - Fix ObjectRef type annotation for from_arrow_refs call - Remove FastFileMetadataProvider (removed from Ray)
1 parent 09ceb5e commit 64a26bd

4 files changed

Lines changed: 2 additions & 8 deletions

File tree

awswrangler/distributed/ray/modin/_utils.py

Lines changed: 2 additions & 2 deletions
Original file line numberDiff line numberDiff line change
@@ -37,7 +37,7 @@ def _ray_dataset_from_df(df: pd.DataFrame | modin_pd.DataFrame) -> Dataset:
3737
if isinstance(df, modin_pd.DataFrame):
3838
return from_modin(df) # type: ignore[no-any-return]
3939
if isinstance(df, pd.DataFrame):
40-
return from_pandas(df) # type: ignore[no-any-return]
40+
return from_pandas(df)
4141
raise ValueError(f"Unknown DataFrame type: {type(df)}")
4242

4343

@@ -85,7 +85,7 @@ def _is_not_empty(table: pa.Table) -> Any:
8585
)
8686

8787
ref_rows: list[bool] = ray_get([_is_not_empty(arrow_ref) for arrow_ref in arrow_refs])
88-
refs: list[Callable[..., Any]] = [ref for ref_rows, ref in zip(ref_rows, arrow_refs) if ref_rows]
88+
refs: list[ObjectRef[Any]] = [ref for ref_rows, ref in zip(ref_rows, arrow_refs) if ref_rows] # type: ignore[misc]
8989
return _to_modin(
9090
dataset=ray.data.from_arrow_refs(refs) if len(refs) > 0 else ray.data.from_arrow([pa.Table.from_arrays([])]),
9191
to_pandas_kwargs=kwargs,

awswrangler/distributed/ray/modin/s3/_read_orc.py

Lines changed: 0 additions & 2 deletions
Original file line numberDiff line numberDiff line change
@@ -8,7 +8,6 @@
88
import modin.pandas as pd
99
import pyarrow as pa
1010
from ray.data import read_datasource
11-
from ray.data.datasource.file_meta_provider import FastFileMetadataProvider
1211

1312
from awswrangler import _data_types
1413
from awswrangler.distributed.ray.datasources import ArrowORCDatasource
@@ -39,7 +38,6 @@ def _read_orc_distributed(
3938
use_threads=use_threads,
4039
schema=schema,
4140
arrow_orc_args={"columns": columns},
42-
meta_provider=FastFileMetadataProvider(),
4341
)
4442
ray_dataset = read_datasource(
4543
datasource,

awswrangler/distributed/ray/modin/s3/_read_parquet.py

Lines changed: 0 additions & 2 deletions
Original file line numberDiff line numberDiff line change
@@ -8,7 +8,6 @@
88
import pyarrow as pa
99
from ray.data import read_datasource
1010
from ray.data._internal.datasource.parquet_datasource import ParquetDatasource
11-
from ray.data.datasource.file_meta_provider import FastFileMetadataProvider
1211

1312
from awswrangler.distributed.ray.datasources import ArrowParquetBaseDatasource
1413
from awswrangler.distributed.ray.modin._utils import _to_modin
@@ -21,7 +20,6 @@ def _resolve_datasource_parameters(bulk_read: bool, *args: Any, **kwargs: Any) -
2120
if bulk_read:
2221
return {
2322
"datasource": ArrowParquetBaseDatasource(*args, **kwargs),
24-
"meta_provider": FastFileMetadataProvider(),
2523
}
2624
else:
2725
kwargs.pop("path_root")

awswrangler/distributed/ray/modin/s3/_read_text.py

Lines changed: 0 additions & 2 deletions
Original file line numberDiff line numberDiff line change
@@ -8,7 +8,6 @@
88
import modin.pandas as pd
99
from pyarrow import csv
1010
from ray.data import read_datasource
11-
from ray.data.datasource.file_meta_provider import FastFileMetadataProvider
1211

1312
from awswrangler import exceptions
1413
from awswrangler.distributed.ray.datasources import (
@@ -169,7 +168,6 @@ def _read_text_distributed(
169168
version_ids=version_ids,
170169
s3_additional_kwargs=s3_additional_kwargs,
171170
pandas_kwargs=pandas_kwargs,
172-
meta_provider=FastFileMetadataProvider(),
173171
**configuration,
174172
),
175173
override_num_blocks=override_num_blocks,

0 commit comments

Comments
 (0)